NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Joins locales de evidencia estructurada

Documentos, entidades y tablas pueden crear un vecindario de evidencia en tiempo de consulta sin depender de un grafo global inmóvil.

POR QUÉ APARECE

Aparece en 50 documentos, 39 papers y 11 semanas; conecta 8 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD6/10
CONEXIÓN9/10
DOCUMENTOS50
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#70 · RAG · EVALUACIÓN · MODELOS PEQUEÑOS

SHIFT

Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.

Resultado con fuente enlazada · v1
#71 · MODELOS PEQUEÑOS

KG2Cypher

Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.

Resultado con fuente enlazada · v1
#74 · AGENTES · RAG · EVALUACIÓN

Ko-WideSearch

Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.

Resultado con fuente enlazada · v1
#77 · IA APLICADA · EVALUACIÓN

EntMTP

Scheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto. Reporta 1,15x de speedup frente a Hydra y pico de 1,36x frente a Medusa.

Resultado con fuente enlazada · v1
#85 · AGENTES · RAG

TRIAGE

Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.

Resultado con fuente enlazada · v3
#91 · RAG · EVALUACIÓN

AGE

Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.

Resultado con fuente enlazada · v1
#105 · RAG

DynaKRAG

Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.

Resultado con fuente enlazada · v1
#110 · EVALUACIÓN · SEGURIDAD · MULTIMODAL

Pluralis v0.1

Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.

Resultado con fuente enlazada · v1
#113 · MEMORIA · AGENTES · RAG

SearchOS-V1

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.

Resultado con fuente enlazada · v1
#114 · AGENTES · SEGURIDAD

SEED

Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.

Resultado con fuente enlazada · v1
#119 · AGENTES

LongStraw

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

Resultado con fuente enlazada · v3

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

Resultado con fuente enlazada · v2
#150 · RAG · EVALUACIÓN

GLM-RAG

Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial. Los GLM combinan semántica textual y estructura del grafo para recuperar subgrafos relevantes.

Resultado con fuente enlazada · v1
#151 · RAG · MULTIMODAL

DualG-MRAG

Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.

Resultado con fuente enlazada · v1
#35 · SEARCH AGENTS · RL · GENERALIZACIÓN

Cross-Domain Hybrid OPD

El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.

Resultado con fuente enlazada · v1
#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES

Teaching Nemotron Greek

El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.

Resultado con fuente enlazada · v1
#12 · AGENTES · APIs · RAG · EVALUACIÓN

VAKRA

VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.

Resultado con fuente enlazada · v1
#13 · RAG · SQL · CONOCIMIENTO ESTRUCTURADO

SAG

SAG conserva cada chunk como un evento semánticamente completo junto con sus entidades. En tiempo de consulta, las entidades compartidas actúan como claves de join y crean un vecindario local tipo hipergrafo.

Resultado con fuente enlazada · v1
#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN

TTT-Embed

TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.

Resultado con fuente enlazada · v1
#07 · RAG · EVIDENCIA · TRAZABILIDAD

ClueWeaver

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#08 · AGENTES · SERVING · SISTEMAS

TOPAS

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

Síntesis editorial; ampliar lectura · por verificar
#169 · AGENTES · MODELOS PEQUEÑOS

AgentFold

Señal del scout sobre composición o compactación de agentes.

Síntesis editorial; ampliar lectura · por verificar
#42 · RAG · EVALUACIÓN · CODING

ScoreGate

Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.

Resultado con fuente enlazada · v1
#59 · IA APLICADA · EVALUACIÓN

Variable-Width Transformers

Explora Transformers cuyo ancho varía por capa, en vez de mantener la misma dimensión en todo el modelo.

Resultado con fuente enlazada · v1
#69 · AGENTES · RAG · EVALUACIÓN

DiscoBench

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.

Resultado con fuente enlazada · v2
#158 · MEMORIA

ReWorld

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

Síntesis editorial; ampliar lectura · por verificar
#159 · AGENTES · EVALUACIÓN · CODING

SWE Refactor Bench

Señal del scout sobre evaluación de refactors de software por agentes.

Síntesis editorial; ampliar lectura · por verificar
#161 · AGENTES · RAG

CAFE

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

Síntesis editorial; ampliar lectura · por verificar
#163 · AGENTES · SEGURIDAD · MULTIMODAL

StepGuard

Señal del scout sobre compuertas de seguridad a nivel de paso.

Síntesis editorial; ampliar lectura · por verificar
#164 · AGENTES · EVALUACIÓN

RACE

Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.

Síntesis editorial; ampliar lectura · por verificar
#165 · IA APLICADA · EVALUACIÓN

Right Diagnoses, Decorative Reasoning

Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.

Síntesis editorial; ampliar lectura · por verificar
#166 · IA APLICADA · EVALUACIÓN

AsymSpec

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

Síntesis editorial; ampliar lectura · por verificar
#167 · AGENTES · SEGURIDAD

When Tool Outputs Become Commands

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

Síntesis editorial; ampliar lectura · por verificar
#168 · AGENTES

WikiSkill

Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.

Síntesis editorial; ampliar lectura · por verificar
SIGUIENTE EXPERIMENTO

¿Cuándo un join de entidades aporta más que añadir otra capa de embeddings?

INPUT: Un corpus corporativo con eventos completos, entidades estables y consultas multi-hop.

MÉTRICA: recall@k, precisión de enlace, hops válidos y coste de actualización

REGLA DE PARADA: Parar si los joins conectan entidades ambiguas o si el contexto original se pierde.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP