NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 06 · 13–19 Julio 2026
13–19 JULIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 13–19 julio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución. La pregunta de producto que queda abierta es: Los agentes de búsqueda pierden el hilo en investigaciones largas, repiten caminos fallidos y no saben qué partes de una investigación siguen incompletas.

02 / IMPRESCINDIBLE

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token. La pregunta de producto que queda abierta es: El RL basado únicamente en éxito o fracaso final ofrece muy poca información sobre qué decisiones intermedias fueron buenas.

03 / IMPRESCINDIBLE

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa. La pregunta de producto que queda abierta es: Buena parte de lo que sabemos sobre «Zero RL» proviene de modelos considerablemente más pequeños.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    MEMORIA · AGENTES · RAG

    SearchOS-V1

    Convierte la investigación web multiagente en un sistema con estado explícito y persistente.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15257#S4.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    AGENTES · SEGURIDAD

    SEED

    Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural.

    La sección 4 Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14777#S4.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    IA APLICADA · EVALUACIÓN

    Ring-Zero

    Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12395#S4.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    AGENTES · EVALUACIÓN

    AgentCompass

    Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13705#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    MEMORIA · AGENTES · MULTIMODAL

    PalmClaw

    En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

    La sección 4 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13027#S4.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    AGENTES · CODING

    Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundatio

    Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse.

    La sección 3 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12463#S3.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    AGENTES

    LongStraw

    Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores.

    La sección 12 Evaluation Scope informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14952#S12.
    Imprescindibleneeds-reviewLeer ficha
  8. 08
    AGENTES

    Harness Handbook

    Trata el harness agentic como un objeto de ingeniería de primera clase.

    La sección 4 Experiment informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13285#S4.
    Interesanteneeds-reviewLeer ficha
  9. 09
    SEGURIDAD · MULTIMODAL

    OvisOCR2 Technical Report

    Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales.

    La sección 4 Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13639#S4.
    Imprescindibleneeds-reviewLeer ficha
  10. 10
    AGENTES · EVALUACIÓN

    AgentCheck

    Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.

    La sección 5 Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.11098#S5.
    Imprescindibleneeds-reviewLeer ficha
  11. 11
    MEMORIA · AGENTES · MULTIMODAL

    Self-Improving AI Coding Agents Through Accumulated Behavioral Rules

    Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones.

    La sección Experimental Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.13091#S4.
    Imprescindibleneeds-reviewLeer ficha
  12. 12
    AGENTES

    Tracing Agentic Failure from the Flow of Success

    Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.12747#S5.
    Interesanteneeds-reviewLeer ficha
  13. 13
    MEMORIA · AGENTES · RAG

    The Hidden Footprint

    AgentFootprint mide cuánto almacenamiento persistente deja realmente un agente: logs, snapshots, conversaciones, checkpoints y trazas.

    La sección 5 Controlled Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.11149#S5.
    Interesanteneeds-reviewLeer ficha
  14. 14
    AGENTES

    Multi-Head Latent Control

    Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.

    La sección 4 Experiments and Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.14277#S4.
    Interesanteneeds-reviewLeer ficha
  15. 15
    MULTIMODAL

    BadWAM

    Cuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina.

    La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.15207#S5.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration y localizar su resultado principal en la fuente primaria.
  2. Contrastar SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain