NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/SEMANA 32 · AGO 2026
03—09 AGO 202615 PAPERS · 5 SEÑALESREVISIÓN EDITORIAL / 97/100

La memoria deja de ser un almacén y empieza a ser una política.

Quince papers convergen en un cambio de capa: retrieval, memoria, seguridad y optimización empiezan a evolucionar con el comportamiento del agente.

TESIS DEL CORTE

Esta semana la señal más fuerte no está en un nuevo modelo base. Está en cómo el sistema decide qué conservar, qué leer, qué compartir, qué probar y cuándo volver a mirar.

NOTA DE EDICIÓN

El corte combina resultados experimentales, technical reports y benchmarks. La puntuación es una decisión editorial de atención, no una medida objetiva de la importancia científica de cada trabajo.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / MEMORIA COMO APRENDIZAJE

Formar → organizar → recuperar → modificar.

CoEvo-Mem, LiveMem, Agent Memory Distillation y MemWM atacan partes distintas de una misma transición: la memoria deja de ser un depósito pasivo y empieza a decidir qué experiencia sobrevive, cómo se recupera y cómo altera la siguiente acción.

02 / EXPERIENCIA TRANSFERIBLE

Los modelos pequeños pueden heredar procedimientos.

AMD sugiere una economía agentic de dos velocidades: un modelo fuerte ejecuta y organiza experiencia; un modelo pequeño la convierte en trabajo recurrente. La unidad de transferencia puede ser un skill o una memoria versionada.

03 / PROCEDIMIENTO ANTES QUE RAZONAMIENTO

El agente puede fallar antes de empezar a pensar.

Read-Gate, CodeGrep y RAG-Stack desplazan la conversación desde ‘qué modelo razona mejor’ hacia ‘qué secuencia de retrieval, lectura, serving y verificación permite que el razonamiento ocurra’.

04 / EL OPTIMIZADOR SE VUELVE AGENTIC

Elegir el siguiente experimento es parte de la capacidad.

ReASearch y RepoOMP muestran dos escalas de la misma idea: el agente no solo propone una solución, también decide qué evidencia necesita, qué variante probar y cuándo una rama deja de merecer presupuesto.

05 / CONTROL EXPLÍCITO

La privacidad y el discovery se vuelven negociables.

MNC y NiyamAI llevan los permisos a la vida posterior de la información y a la ejecución de acciones; Shape Your Feed lleva la negociación al usuario, que puede corregir el algoritmo en lenguaje natural.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    MEMORIA · AGENTES · RETRIEVAL

    CoEvo-Mem

    La memoria de un agente no debería evolucionar separada de la política que decide qué recuerdos consultar.

    Experimentos en siete benchmarks de memoria conversacional, razonamiento científico y multimodal, código, interacción con sistemas operativos y tool-use; el paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    SLM · MEMORIA · TOOL-USE

    Agent Memory Distillation

    Un modelo pequeño puede heredar experiencia operacional de uno grande sin recibir sus pesos: basta con transferir memoria estructurada y utilizable.

    Evaluación con cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use; las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    CODING AGENTS · RETRIEVAL · RL

    CodeGrep

    Muchos coding agents consumen el presupuesto buscando qué archivo tocar; CodeGrep separa esa exploración y la entrena como una capacidad propia.

    500 issues de SWE-Bench Verified: 27,0% de resolución frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en issues resueltas; el umbral de precisión de CodeGrep es 0,677.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    RAG · INFRAESTRUCTURA · EFICIENCIA

    RAG-Stack

    Un RAG de producción no se elige por accuracy aislada: se elige en una frontera de calidad, coste, hardware y latencia.

    En distintos datasets, las fronteras Pareto encontradas cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que métodos de búsqueda comparados con el mismo presupuesto de iteraciones.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO

    Before Reasoning Can Fail

    Un agente puede encontrar la evidencia correcta y aun así responder sin haberla leído: el fallo ocurre antes del razonamiento.

    El análisis usa 12.000 trayectorias emparejadas en HotpotQA, 2WikiMultiHopQA y MuSiQue; Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    REASONING · OPTIMIZACIÓN · AI SCIENTIST

    ReASearch

    El agente deja de ser el generador de candidatos dentro del optimizador y empieza a decidir qué probar, cómo diagnosticar y cuándo parar.

    En 14 tareas de prompts, programas y workflows ML, el paper reporta mejoras de 2% a 40% sobre baselines especializados y, en algunos casos, soluciones por encima de resultados humanos conocidos.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    MEMORIA INTRÍNSECA · LONG-CONTEXT

    LiveMem

    Recordar no es solo poder recuperar un texto antiguo: es conservar continuidad computacional cuando el contexto activo cambia.

    En LongMemEval, LiveMem conserva capacidad de responder usando memoria aun cuando la evidencia original se ha retirado del contexto activo; el paper lo presenta como estado de continuidad complementario a RAG.
    Imprescindibleneeds-reviewLeer ficha
  8. 08
    SAFETY · POLÍTICAS · CRIPTOGRAFÍA

    NiyamAI

    El guardrail deja de ser solo una instrucción: se convierte en un contrato de intención cuya aplicación puede verificarse.

    En 2.000 escenarios de Agent-SafetyBench, NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms por acción aprobada y verificarla 53,1 ± 11,8 ms.
    Interesanteneeds-reviewLeer ficha
  9. 09
    DISCOVERY · RECOMENDACIÓN · AGENTES

    Shape Your Feed

    El usuario deja de ser una señal pasiva de clics y empieza a co-curar explícitamente lo que el sistema debe mostrarle.

    El paper reporta 98,85% de accuracy en su módulo de alignment y experimentos A/B online sobre tráfico de producción con mejoras de relevancia y sentimiento del usuario.
    Imprescindibleneeds-reviewLeer ficha
  10. 10
    WORLD MODELS · MEMORIA · PLANIFICACIÓN

    MemWM

    Imaginar un futuro plausible no basta si el modelo olvida una regla, atributo o estado que cambia la decisión.

    La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT; en ALFWorld, WebShop y ScienceWorld el agente obtiene hasta 65,4% de mejora relativa sobre el agente con world model SFT.
    Interesanteneeds-reviewLeer ficha
  11. 11
    CODE · RETRIEVAL · OPTIMIZACIÓN

    RepoOMP

    Para paralelizar código no hay que inundar al agente con el repositorio: hay que recuperar la evidencia de dependencias que decide si la transformación es legal y rentable.

    Sobre 951 hotspots, acepta 372 transformaciones y 330 hotspots reales; reporta mediana de 2,25× en los aceptados reales, reducción de 47–68% de tokens y mejoras de speedup del 18–28% frente a Claude Code sin contexto estructurado.
    Interesanteneeds-reviewLeer ficha
  12. 12
    PRIVACIDAD · MULTIAGENTE · POLÍTICAS

    MNC

    Un agente puede necesitar comunicar algo sin tener permiso para entregar todo lo que sabe ni perder el control de lo que ocurra después.

    El protocolo propone MNC-C para el núcleo, MNC-L para riesgo acumulado por historial y MNC-D para el caso en que no exista una divulgación segura: delegación privada, abstención o aprobación del usuario.
    Interesanteneeds-reviewLeer ficha
  13. 13
    SEARCH AGENTS · RL · GENERALIZACIÓN

    Cross-Domain Hybrid OPD

    Especializar un modelo para buscar no debería obligarlo a olvidar cómo ser un asistente general.

    El technical report evalúa el framework de Yuanbao y sostiene que la búsqueda especializada mejora sin pagar el alignment tax habitual; la ficha no convierte esa afirmación en un número único fuera de los experimentos del paper.
    Interesanteneeds-reviewLeer ficha
  14. 14
    MULTIMODAL · EVALUACIÓN · HALLUCINATION

    KnowHal

    Un modelo puede ver bien una imagen y aun así inventar conocimiento o aceptar una premisa falsa sobre ella.

    KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías; evalúa 14 MLLMs y encuentra que knowledge hallucination es la dimensión más difícil y que las preguntas negativas degradan notablemente el rendimiento.
    Interesanteneeds-reviewLeer ficha
  15. 15
    RAG · MULTILINGÜE · MODELOS EFICIENTES

    Teaching Nemotron Greek

    La etiqueta multilingual no garantiza que un RAG funcione en un idioma y un dominio concretos: hay que adaptar corpus, retrieval y generación juntos.

    Con 65.773 pares de retrieval, el embedder Nemotron 1B sube nDCG@10 de 0,362 a 0,835; el reader Nemotron 30B-A3B pasa de 29,4% a 66,9% de corrección juzgada y mejora grounding y citas.
    Interesanteneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Añadir un Read-Gate al harness de Research IA: nunca finalizar después de buscar sin un evento de lectura verificable.
  2. Construir una memoria experimental con procedencia, versión y utilidad observada, separando memoria de consulta, tarea y agente.
  3. Medir cualquier RAG en una frontera conjunta de calidad, p95, coste y throughput antes de cambiar de modelo.
  4. Elegir un workflow repetido y dejar que un agente proponga una sola siguiente prueba con métrica y criterio de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • SOTA, A/B online o ‘release anunciada’ no equivalen a reproducibilidad inmediata.
  • Una memoria más persistente también puede conservar errores, permisos caducados o inferencias no deseadas.
  • Un agente que optimiza solo la métrica visible puede mejorar el benchmark y empeorar coste, robustez o confianza.
Guardar una nota en Second Brain