NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 01

MEMORIA · AGENTES · RAG

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

ImprescindibleLectura primaria completa

Convierte la investigación web multiagente en un sistema con estado explícito y persistente.

AUTHORS / LABYuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou
FECHA16 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.

EVIDENCIA DISPONIBLE

Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9…

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.

SEÑALconsultoría · inversión
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9…

contexto: 4 Experiments

RESULTADO REPORTADO

SearchOS achieves the best overall performance on both benchmarks, leading on all six headline F1 metrics across the two benchmarks while remaining competitive on the precision-oriented metrics.

contexto: 4 Experiments

RESULTADO REPORTADO

On WideSearch , SearchOS attains the best Item-level Precision ( 83.9 ), Recall ( 79.7 ), and F1 ( 80.3 ), improving over the strongest baseline (A-MapReduce, 76.0 F1) by +4.3 points.

baseline: Comparación declarada en la sección de evaluación · contexto: 4 Experiments

RESULTADO REPORTADO

The gain is concentrated in recall, consistent with the design goal of using coverage-aware dispatch to reduce missing cells , while precision remains the highest among all methods.

contexto: 4 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.

MÉTODO / La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema [Fuente: https://arxiv.org/html/2607.15257#S2]

RESULTADO / La sección 4 Experiments informa: Single Agent Multi-Agent System Benchmark Metric ReAct Plan-and-Solve Table-as-Search A-MapReduce Web2BigTable Ours \Delta WideSearch Item \cdot Precision 82.9 83.8 82.4 83.1 78.3 83.9 +0.1 Item \cdot Recall 70.2 72.9 73.5 74.2 73.4 79.7 +5.5 Item \cdot F1 72.9 75.2 75.4 76.0 73.8 80.3 +4.3 Row \cdot Precision 58.0 58.7 57.1 56.9 57.5 59.0 +0.3 Row \cdot Recall 48.8 50.2 51.6 49.8 54.0 55.8 +1.8 Row \cdot F1 50.9… SearchOS achieves the best overall performance on both benchmarks, leading on all six headline F1 metrics across the two benchmarks while remaining competitive on the precision-oriented metrics. On WideSearch , SearchOS attains the best Item-level Precision ( 83.9 ), Recall ( 79.7 ), and F1 ( 80.3 ), improving over the strongest baseline (A-MapReduce, 76.0 F1) by +4.3 points. [Fuente: https://arxiv.org/html/2607.15257#S4]

LÍMITE / El cierre de la fuente señala: The following interface snapshots are ordered by case number and then by step number. Each row contains two snapshots. La transferencia a deep research requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.15257#S7].

DECISIÓN RÁPIDAProbar la propuesta en deep research reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

PROBLEMA
Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.
MÉTODO
La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema
TIPO DE EVIDENCIA
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15257#S4.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Problem Formulation describe la intervención y su construcción: We formulate open-domain information seeking as relational schema completion with grounded citations . Following relational database design, we use primary keys to identify entities, foreign keys to express cross-table relations, and normalized tables to reduce redundant or inconsistent fact representations ( Codd 1970 ; Bernstein 1976 ) . Given a natural-language request q , the system constructs a relational search schema

QUÉ APORTA

Para mí es el paper estratégico de la semana. La siguiente generación de Deep Research no será simplemente «más búsquedas», sino gestión explícita de cobertura, evidencia, fallos y procedencia. Esto tiene implicaciones directas para cómo una empresa consigue ser descubierta y citada por asistentes: la información debe poder convertirse en evidencia estructurada y trazable.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en deep research reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

deep researchinteligencia competitivadue diligenceinvestigación de mercadosgeneración de listas exhaustivasasistentes de compra y búsqueda empresarial.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando deep research cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAdeep research con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora deep research frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si deep research puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.