NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Memoria como política de recuperación

La memoria deja de ser un almacén: decide qué conservar, cuándo recuperar y qué evidencia puede modificar una respuesta.

POR QUÉ APARECE

Aparece en 59 documentos, 37 papers y 11 semanas; conecta 9 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN10/10
DOCUMENTOS59
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#40 · RAG · EVALUACIÓN · SEGURIDAD

FactoryLLM

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.

Resultado con fuente enlazada · v1

Reporte de workshop sobre cómo la IA generativa transforma la búsqueda académica: de recuperar documentos a resumir, recomendar, sintetizar y conversar. Destaca transparencia, credibilidad, integridad investigadora y search-as-learning.

Resultado con fuente enlazada · v1
#58 · AGENTES · EVALUACIÓN

Beyond Static Leaderboards

Evalúa si los benchmarks de agentes predicen desempeño fuera de la muestra, no solo rankings estáticos.

Resultado con fuente enlazada · v1
#68 · MEMORIA · AGENTES

Supersede

Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded.

Resultado con fuente enlazada · v1

Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.

Resultado con fuente enlazada · v2
#86 · AGENTES · EVALUACIÓN

ReContext

Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.

Resultado con fuente enlazada · v1
#99 · AGENTES

Eluna

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.

Resultado con fuente enlazada · v1
#100 · AGENTES · CODING

TTHE

Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.

Resultado con fuente enlazada · v1
#106 · MEMORIA

MILES

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

Resultado con fuente enlazada · v1
#107 · AGENTES · EVALUACIÓN

SMetric

Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales. La primera petición se distribuye según carga y las siguientes se enrutan teniendo en cuenta la reutilización de caché.

Resultado con fuente enlazada · v1
#108 · MULTIMODAL · MODELOS PEQUEÑOS

InternVLA-A1.5

Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.

Resultado con fuente enlazada · v1
#111 · AGENTES · EVALUACIÓN

LongMedBench

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

Resultado con fuente enlazada · v2
#120 · AGENTES

Harness Handbook

Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.

Resultado con fuente enlazada · v1

SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.

Resultado con fuente enlazada · v1

TAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.

Resultado con fuente enlazada · v1
#143 · MEMORIA · AGENTES · EVALUACIÓN

TransMem

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

Resultado con fuente enlazada · v1
#151 · RAG · MULTIMODAL

DualG-MRAG

Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.

Resultado con fuente enlazada · v1
#152 · MEMORIA · AGENTES · MODELOS PEQUEÑOS

NeSyFS

Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.

Resultado con fuente enlazada · v2
#23 · MEMORIA · AGENTES · RETRIEVAL

CoEvo-Mem

CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.

Resultado con fuente enlazada · v1
#24 · SLM · MEMORIA · TOOL-USE

Agent Memory Distillation

AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.

Resultado con fuente enlazada · v1
#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST

ReASearch

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

Resultado con fuente enlazada · v1
#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT

LiveMem

LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.

Resultado con fuente enlazada · v2
#16 · RECOVERY · REASONING · AGENTES

Diagnosis Before Recovery

El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.

Resultado con fuente enlazada · v1
#04 · RAG · RETRIEVAL · DECISIÓN

MetaRAG

MetaRAG formula la generación aumentada como una política adaptativa con Verify-first Action Generation e Internal Belief Probing durante el entrenamiento.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD

SPA

SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.

Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026
#158 · MEMORIA

ReWorld

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

Síntesis editorial; ampliar lectura · por verificar
#05 · RAG · ABSTENCIÓN · EVALUACIÓN

The RAT

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#08 · AGENTES · SERVING · SISTEMAS

TOPAS

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026
#10 · AGENTES · CODING · HARNESS

The Devil Is in the Interface

El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.

Resultado con fuente enlazada · v1
#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN

TTT-Embed

TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.

Resultado con fuente enlazada · v1
#20 · MULTIMODAL · SAE · CONTROL

MMDiff

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

Resultado con fuente enlazada · v1
#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN

VibeLifeBench

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

Resultado con fuente enlazada · v1
#22 · MULTIMODAL · NEGOCIO · BENCHMARK

MBA

MBA-Bench reúne 30.000 muestras en seis dominios. El pipeline combina imagen, caption, consultas extraídas visualmente y evidencia de mercado recuperada de la web para producir ideas de negocio.

Resultado con fuente enlazada · v1
#25 · CODING AGENTS · RETRIEVAL · RL

CodeGrep

CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.

Resultado con fuente enlazada · v1
#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA

NiyamAI

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

Resultado con fuente enlazada · v1
#33 · CODE · RETRIEVAL · OPTIMIZACIÓN

RepoOMP

RepoOMP construye un grafo de atributos de rendimiento, enruta hotspots entre reglas deterministas y agente LLM, y compone un contexto estructurado con las dependencias relevantes.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué política de recuperación conserva utilidad sin arrastrar contexto irrelevante?

INPUT: Comparar memoria de sesión, memoria de tarea y memoria global en un workflow repetido.

MÉTRICA: recall de evidencia, precisión, tokens recuperados y stale-memory rate

REGLA DE PARADA: Parar si la memoria mejora recall pero empeora precisión o introduce datos obsoletos.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP