Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución. La pregunta de producto que queda abierta es: Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token. La pregunta de producto que queda abierta es: El RL basado únicamente en éxito o fracaso final ofrece muy poca información sobre qué decisiones intermedias fueron buenas.
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa. La pregunta de producto que queda abierta es: Buena parte de lo que sabemos sobre «Zero RL» proviene de modelos considerablemente más pequeños.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
MEMORIA · AGENTES · RAG
SearchOS-V1
Convierte la investigación web multiagente en un sistema con estado explícito y persistente.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15257#S4.
Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural.
La sección 4 Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14777#S4.
Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12395#S4.
Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13705#S4.
En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.
La sección 4 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13027#S4.
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundatio
Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse.
La sección 3 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12463#S3.
Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores.
La sección 12 Evaluation Scope informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14952#S12.
Trata el harness agentic como un objeto de ingeniería de primera clase.
La sección 4 Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13285#S4.
Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales.
La sección 4 Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13639#S4.
Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.
La sección 5 Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.11098#S5.
Self-Improving AI Coding Agents Through Accumulated Behavioral Rules
Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones.
La sección Experimental Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13091#S4.
Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12747#S5.
AgentFootprint mide cuánto almacenamiento persistente deja realmente un agente: logs, snapshots, conversaciones, checkpoints y trazas.
La sección 5 Controlled Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.11149#S5.
Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.
La sección 4 Experiments and Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14277#S4.
Cuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina.
La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15207#S5.
Abrir SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration y localizar su resultado principal en la fuente primaria.
Contrastar SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR
La señal también tiene sombra.
Una ficha abierta no equivale a una recomendación de adopción.
Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.