Esta semana la señal más fuerte no está en un nuevo modelo base. Está en cómo el sistema decide qué conservar, qué leer, qué compartir, qué probar y cuándo volver a mirar.
NOTA DE EDICIÓN
El corte combina resultados experimentales, technical reports y benchmarks. La puntuación es una decisión editorial de atención, no una medida objetiva de la importancia científica de cada trabajo.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / MEMORIA COMO APRENDIZAJE
Formar → organizar → recuperar → modificar.
CoEvo-Mem, LiveMem, Agent Memory Distillation y MemWM atacan partes distintas de una misma transición: la memoria deja de ser un depósito pasivo y empieza a decidir qué experiencia sobrevive, cómo se recupera y cómo altera la siguiente acción.
Los modelos pequeños pueden heredar procedimientos.
AMD sugiere una economía agentic de dos velocidades: un modelo fuerte ejecuta y organiza experiencia; un modelo pequeño la convierte en trabajo recurrente. La unidad de transferencia puede ser un skill o una memoria versionada.
Read-Gate, CodeGrep y RAG-Stack desplazan la conversación desde ‘qué modelo razona mejor’ hacia ‘qué secuencia de retrieval, lectura, serving y verificación permite que el razonamiento ocurra’.
Elegir el siguiente experimento es parte de la capacidad.
ReASearch y RepoOMP muestran dos escalas de la misma idea: el agente no solo propone una solución, también decide qué evidencia necesita, qué variante probar y cuándo una rama deja de merecer presupuesto.
La privacidad y el discovery se vuelven negociables.
MNC y NiyamAI llevan los permisos a la vida posterior de la información y a la ejecución de acciones; Shape Your Feed lleva la negociación al usuario, que puede corregir el algoritmo en lenguaje natural.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
MEMORIA · AGENTES · RETRIEVAL
CoEvo-Mem
La memoria de un agente no debería evolucionar separada de la política que decide qué recuerdos consultar.
Experimentos en siete benchmarks de memoria conversacional, razonamiento científico y multimodal, código, interacción con sistemas operativos y tool-use; el paper reporta mejoras de hasta 7,50 puntos sobre el baseline más fuerte.
Un modelo pequeño puede heredar experiencia operacional de uno grande sin recibir sus pesos: basta con transferir memoria estructurada y utilizable.
Evaluación con cuatro modelos estudiantes de 4B–8B, GPT-5-mini como teacher y tres benchmarks de tool-use; las ganancias medias reportadas son +27,2 puntos en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox.
Muchos coding agents consumen el presupuesto buscando qué archivo tocar; CodeGrep separa esa exploración y la entrena como una capacidad propia.
500 issues de SWE-Bench Verified: 27,0% de resolución frente a 25,8% sin retrieval, con 15% menos rondas y 19% menos tokens en issues resueltas; el umbral de precisión de CodeGrep es 0,677.
Un RAG de producción no se elige por accuracy aislada: se elige en una frontera de calidad, coste, hardware y latencia.
En distintos datasets, las fronteras Pareto encontradas cubren entre 52,5% y 153,2% más del espacio normalizado calidad-rendimiento que métodos de búsqueda comparados con el mismo presupuesto de iteraciones.
Un agente puede encontrar la evidencia correcta y aun así responder sin haberla leído: el fallo ocurre antes del razonamiento.
El análisis usa 12.000 trayectorias emparejadas en HotpotQA, 2WikiMultiHopQA y MuSiQue; Read-Gate mejora entre 14,9 y 19,9 puntos en las trayectorias que se habrían saltado la lectura.
El agente deja de ser el generador de candidatos dentro del optimizador y empieza a decidir qué probar, cómo diagnosticar y cuándo parar.
En 14 tareas de prompts, programas y workflows ML, el paper reporta mejoras de 2% a 40% sobre baselines especializados y, en algunos casos, soluciones por encima de resultados humanos conocidos.
Recordar no es solo poder recuperar un texto antiguo: es conservar continuidad computacional cuando el contexto activo cambia.
En LongMemEval, LiveMem conserva capacidad de responder usando memoria aun cuando la evidencia original se ha retirado del contexto activo; el paper lo presenta como estado de continuidad complementario a RAG.
El guardrail deja de ser solo una instrucción: se convierte en un contrato de intención cuya aplicación puede verificarse.
En 2.000 escenarios de Agent-SafetyBench, NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms por acción aprobada y verificarla 53,1 ± 11,8 ms.
El usuario deja de ser una señal pasiva de clics y empieza a co-curar explícitamente lo que el sistema debe mostrarle.
El paper reporta 98,85% de accuracy en su módulo de alignment y experimentos A/B online sobre tráfico de producción con mejoras de relevancia y sentimiento del usuario.
Imaginar un futuro plausible no basta si el modelo olvida una regla, atributo o estado que cambia la decisión.
La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT; en ALFWorld, WebShop y ScienceWorld el agente obtiene hasta 65,4% de mejora relativa sobre el agente con world model SFT.
Para paralelizar código no hay que inundar al agente con el repositorio: hay que recuperar la evidencia de dependencias que decide si la transformación es legal y rentable.
Sobre 951 hotspots, acepta 372 transformaciones y 330 hotspots reales; reporta mediana de 2,25× en los aceptados reales, reducción de 47–68% de tokens y mejoras de speedup del 18–28% frente a Claude Code sin contexto estructurado.
Un agente puede necesitar comunicar algo sin tener permiso para entregar todo lo que sabe ni perder el control de lo que ocurra después.
El protocolo propone MNC-C para el núcleo, MNC-L para riesgo acumulado por historial y MNC-D para el caso en que no exista una divulgación segura: delegación privada, abstención o aprobación del usuario.
Especializar un modelo para buscar no debería obligarlo a olvidar cómo ser un asistente general.
El technical report evalúa el framework de Yuanbao y sostiene que la búsqueda especializada mejora sin pagar el alignment tax habitual; la ficha no convierte esa afirmación en un número único fuera de los experimentos del paper.
Un modelo puede ver bien una imagen y aun así inventar conocimiento o aceptar una premisa falsa sobre ella.
KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías; evalúa 14 MLLMs y encuentra que knowledge hallucination es la dimensión más difícil y que las preguntas negativas degradan notablemente el rendimiento.
La etiqueta multilingual no garantiza que un RAG funcione en un idioma y un dominio concretos: hay que adaptar corpus, retrieval y generación juntos.
Con 65.773 pares de retrieval, el embedder Nemotron 1B sube nDCG@10 de 0,362 a 0,835; el reader Nemotron 30B-A3B pasa de 29,4% a 66,9% de corrección juzgada y mejora grounding y citas.