NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Retrieval adaptativo y ranking con feedback

El ranking, el reranking y la adaptación de embeddings convierten la señal de uso en una política de recuperación que puede aprender.

POR QUÉ APARECE

Aparece en 43 documentos, 31 papers y 9 semanas; conecta 8 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN9/10
DOCUMENTOS43
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#40 · RAG · EVALUACIÓN · SEGURIDAD

FactoryLLM

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.

Resultado con fuente enlazada · v1
#42 · RAG · EVALUACIÓN · CODING

ScoreGate

Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.

Resultado con fuente enlazada · v1
#46 · CODING

CompRank

Framework de reranking con LLMs que comprime tokens y evita scoring generativo. En TREC-COVID mantiene estabilidad con listas de hasta 500 documentos, logrando speedups de 4,9x–9,5x frente a reranking listwise generativo.

Resultado con fuente enlazada · v1
#47 · AGENTES · SEGURIDAD · MULTIMODAL

IAPO

Método RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.

Resultado con fuente enlazada · v1
#88 · IA APLICADA · EVALUACIÓN

RaBitQCache

Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.

Resultado con fuente enlazada · v1
#89 · AGENTES · EVALUACIÓN · SEGURIDAD

EvoPolicyGym

Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.

Resultado con fuente enlazada · v1
#90 · MEMORIA

DRIFTLENS

Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.

Resultado con fuente enlazada · v2
#91 · RAG · EVALUACIÓN

AGE

Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.

Resultado con fuente enlazada · v1
#100 · AGENTES · CODING

TTHE

Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.

Resultado con fuente enlazada · v1
#106 · MEMORIA

MILES

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

Resultado con fuente enlazada · v1
#107 · AGENTES · EVALUACIÓN

SMetric

Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales. La primera petición se distribuye según carga y las siguientes se enrutan teniendo en cuenta la reutilización de caché.

Resultado con fuente enlazada · v1
#111 · AGENTES · EVALUACIÓN

LongMedBench

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

Resultado con fuente enlazada · v2

TAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.

Resultado con fuente enlazada · v1

Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.

Resultado con fuente enlazada · v1
#149 · RAG · EVALUACIÓN · CODING

DenseOn with the LateOn

Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía. Reconstruye 665 millones de pares públicos de pretraining, crea 1,88 millones de pares supervisados y extiende el entrenamiento a ocho idiomas.

Resultado con fuente enlazada · v2
#151 · RAG · MULTIMODAL

DualG-MRAG

Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.

Resultado con fuente enlazada · v1
#23 · MEMORIA · AGENTES · RETRIEVAL

CoEvo-Mem

CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.

Resultado con fuente enlazada · v1
#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA

NiyamAI

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

Resultado con fuente enlazada · v1
#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN

TTT-Embed

TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.

Resultado con fuente enlazada · v1
#01 · AGENTES · MÓVIL · EVALUACIÓN

MobilePA-Bench

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026
#05 · RAG · ABSTENCIÓN · EVALUACIÓN

The RAT

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#158 · MEMORIA

ReWorld

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

Síntesis editorial; ampliar lectura · por verificar
#161 · AGENTES · RAG

CAFE

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

Síntesis editorial; ampliar lectura · por verificar
#166 · IA APLICADA · EVALUACIÓN

AsymSpec

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

Síntesis editorial; ampliar lectura · por verificar
#02 · AGENTES · TOOL USE · LATENCIA

OODA-Tool

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#17 · RANKING · RECOMMENDACIÓN · SLM

MetaStrategy

MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.

Resultado con fuente enlazada · v1
#26 · RAG · INFRAESTRUCTURA · EFICIENCIA

RAG-Stack

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

Resultado con fuente enlazada · v1
#31 · DISCOVERY · RECOMENDACIÓN · AGENTES

Shape Your Feed

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

Resultado con fuente enlazada · v1
#87 · AGENTES · EVALUACIÓN

PACE

Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas. En 14 modelos, 4 benchmarks agentic y 19 no-agentic, logra MAE menor del 4%, Spearman >0.80 y ranking accuracy \~85% con menos del 1% del coste.

Resultado con fuente enlazada · v2
#143 · MEMORIA · AGENTES · EVALUACIÓN

TransMem

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué feedback merece persistir como memoria de consulta y qué feedback sólo sirve para esa sesión?

INPUT: Comparar adaptación local, memoria de tarea y política global sobre consultas repetidas.

MÉTRICA: nDCG, recall, drift, tokens y estabilidad entre sesiones

REGLA DE PARADA: Parar si la adaptación local mejora una consulta y degrada la distribución general.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP