Lo esencial antes de invertir más tiempo.
Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Under the Neutral setting, the best-performing model, Doubao-Seed-2.0-Pro, achieves only 43.1% end-to-end accuracy, while Gemini-3.1-Pro reaches 40.8%.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Qué está reportado y qué conviene comprobar.
Under the Neutral setting, the best-performing model, Doubao-Seed-2.0-Pro, achieves only 43.1% end-to-end accuracy, while Gemini-3.1-Pro reaches 40.8%.
43.1% · contexto: 5 Experiments
Most other models remain below 40%, and weaker models such as MiniMax-M2.7 and Qwen3.6-Max achieve only 16.1% and 12.3%, respectively.
40% · contexto: 5 Experiments
For example, Claude-Opus-4.7 achieves a checkpoint pass rate of 57.0% but only 39.8% accuracy.
57.0% · contexto: 5 Experiments
Guided prompting generally improves model performance by explicitly encouraging the agent to identify ambiguity and ask clarification questions when necessary.
contexto: 5 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque los agentes deep-search asumen que la query del usuario es completa.
MÉTODO / La lectura de 4 Methodology of Dataset Construction describe la intervención y su construcción: We construct DiscoBench , an interactive ambiguous question answering (QA) benchmark designed to evaluate whether LLMs can identify ambiguity, proactively request clarification, and recover correct reasoning trajectories in multi-turn open-domain search tasks. As illustrated in Fig. 3 , the construction pipeline consists of two phases: (1) Seed Data Preparation , which builds high-quality multi-hop reasoning chains, and (2) Ambiguous Data Construction , which injects ambiguity and generates discriminative facts for interactive disambiguation. The entire pipeline adopts a semi-automatic collaborative framework.… [Fuente: https://arxiv.org/html/2606.27669#S4]
RESULTADO / La sección 5 Experiments informa: Under the Neutral setting, the best-performing model, Doubao-Seed-2.0-Pro, achieves only 43.1% end-to-end accuracy, while Gemini-3.1-Pro reaches 40.8%. Most other models remain below 40%, and weaker models such as MiniMax-M2.7 and Qwen3.6-Max achieve only 16.1% and 12.3%, respectively. For example, Claude-Opus-4.7 achieves a checkpoint pass rate of 57.0% but only 39.8% accuracy. [Fuente: https://arxiv.org/html/2606.27669#S5]
LÍMITE / El cierre de la fuente señala: We introduced DiscoBench , a benchmark for evaluating clarification-aware deep search. DiscoBench models ambiguity as a dynamic issue that emerges during multi-step search and uses structured checkpoints to evaluate whether search agents can detect ambiguity, ask for clarification, and recover correct reasoning paths with user-provided clues. Experiments show that current LLM-based search agents still struggle with interactive deep search. Guided… La transferencia a agentes web requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.27669#S6].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- PROBLEMA
- Los agentes deep-search asumen que la query del usuario es completa.
- MÉTODO
- La lectura de 4 Methodology of Dataset Construction describe la intervención y su construcción: We construct DiscoBench , an interactive ambiguous question answering (QA) benchmark designed to evaluate whether LLMs can identify ambiguity, proactively request clarification, and recover correct reasoning trajectories in multi-turn open-domain search tasks. As illustrated in Fig. 3 , the construction pipeline consists of two phases: (1) Seed Data Preparation , which builds high-quality multi-hop reasoning chains, and (2) Ambiguous Data Construction , which injects ambiguity and generates discriminative facts for interactive disambiguation. The entire pipeline adopts a semi-automatic collaborative framework.…
- TIPO DE EVIDENCIA
- La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27669#S5.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 4 Methodology of Dataset Construction describe la intervención y su construcción: We construct DiscoBench , an interactive ambiguous question answering (QA) benchmark designed to evaluate whether LLMs can identify ambiguity, proactively request clarification, and recover correct reasoning trajectories in multi-turn open-domain search tasks. As illustrated in Fig. 3 , the construction pipeline consists of two phases: (1) Seed Data Preparation , which builds high-quality multi-hop reasoning chains, and (2) Ambiguous Data Construction , which injects ambiguity and generates discriminative facts for interactive disambiguation. The entire pipeline adopts a semi-automatic collaborative framework.…
Afecta directamente a asistentes de investigación, soporte y búsqueda empresarial.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en agentes web reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando agentes web cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si agentes web puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.