Lo esencial antes de invertir más tiempo.
Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9…
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
Qué está reportado y qué conviene comprobar.
Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9…
contexto: 4 Experiments
SearchOS achieves the best overall performance on both benchmarks, leading on all six headline F1 metrics across the two benchmarks while remaining competitive on the precision-oriented metrics.
contexto: 4 Experiments
On WideSearch , SearchOS attains the best Item-level Precision ( 83.9 ), Recall ( 79.7 ), and F1 ( 80.3 ), improving over the strongest baseline (A-MapReduce, 76.0 F1) by +4.3 points.
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments
The gain is concentrated in recall, consistent with the design goal of using coverage-aware dispatch to reduce missing cells , while precision remains the highest among all methods.
contexto: 4 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.
MÉTODO / La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema [Fuente: https://arxiv.org/html/2607.15257#S2]
RESULTADO / La sección 4 Experiments informa: Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9… SearchOS achieves the best overall performance on both benchmarks, leading on all six headline F1 metrics across the two benchmarks while remaining competitive on the precision-oriented metrics. On WideSearch , SearchOS attains the best Item-level Precision ( 83.9 ), Recall ( 79.7 ), and F1 ( 80.3 ), improving over the strongest baseline (A-MapReduce, 76.0 F1) by +4.3 points. [Fuente: https://arxiv.org/html/2607.15257#S4]
LÍMITE / El cierre de la fuente señala: The following interface snapshots are ordered by case number and then by step number. Each row contains two snapshots. La transferencia a deep research requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.15257#S7].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- PROBLEMA
- Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.
- MÉTODO
- La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema
- TIPO DE EVIDENCIA
- La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15257#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema
Para mí es el paper estratégico de la semana. La siguiente generación de Deep Research no será simplemente «más búsquedas», sino gestión explícita de cobertura, evidencia, fallos y procedencia. Esto tiene implicaciones directas para cómo una empresa consigue ser descubierta y citada por asistentes: la información debe poder convertirse en evidencia estructurada y trazable.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en deep research reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando deep research cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si deep research puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.