NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Evidence gates antes del reasoning

Leer, recuperar y verificar una evidencia antes de razonar evita que el agente construya una trayectoria sobre una premisa ausente.

POR QUÉ APARECE

Aparece en 42 documentos, 31 papers y 11 semanas; conecta 8 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN9/10
DOCUMENTOS42
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#55 · AGENTES · EVALUACIÓN

RODS

Genera datos online para entrenamiento RL de agentes tool-use, identificando muestras cerca del límite de capacidad mediante varianza de recompensa.

Resultado con fuente enlazada · v1
#70 · RAG · EVALUACIÓN · MODELOS PEQUEÑOS

SHIFT

Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.

Resultado con fuente enlazada · v1

Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.

Resultado con fuente enlazada · v2
#86 · AGENTES · EVALUACIÓN

ReContext

Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.

Resultado con fuente enlazada · v1
#101 · AGENTES · RAG

Multi-Agent AI Control

Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.

Resultado con fuente enlazada · v1
#105 · RAG

DynaKRAG

Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.

Resultado con fuente enlazada · v1

Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

Resultado con fuente enlazada · v1

En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.

Resultado con fuente enlazada · v2
#133 · RAG · SEGURIDAD · MODELOS PEQUEÑOS

Sound Probabilistic Safety Bounds for Large Language Models

En vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino. Usa intervalos Clopper-Pearson y búsqueda guiada mediante representaciones latentes para explorar eficientemente ramas peligrosas del árbol autoregresivo.

Resultado con fuente enlazada · v1
#147 · AGENTES · RAG · EVALUACIÓN

WorkSurface-Bench

Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.

Resultado con fuente enlazada · v1
#150 · RAG · EVALUACIÓN

GLM-RAG

Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial. Los GLM combinan semántica textual y estructura del grafo para recuperar subgrafos relevantes.

Resultado con fuente enlazada · v1
#27 · AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO

Before Reasoning Can Fail

El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.

Resultado con fuente enlazada · v2
#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT

LiveMem

LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.

Resultado con fuente enlazada · v2
#36 · MULTIMODAL · EVALUACIÓN · HALLUCINATION

KnowHal

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

Resultado con fuente enlazada · v1
#12 · AGENTES · APIs · RAG · EVALUACIÓN

VAKRA

VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.

Resultado con fuente enlazada · v1
#01 · AGENTES · MÓVIL · EVALUACIÓN

MobilePA-Bench

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026
#03 · AGENTES · GUI · SEGURIDAD

AnTrap

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#04 · RAG · RETRIEVAL · DECISIÓN

MetaRAG

MetaRAG formula la generación aumentada como una política adaptativa con Verify-first Action Generation e Internal Belief Probing durante el entrenamiento.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#07 · RAG · EVIDENCIA · TRAZABILIDAD

ClueWeaver

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#159 · AGENTES · EVALUACIÓN · CODING

SWE Refactor Bench

Señal del scout sobre evaluación de refactors de software por agentes.

Síntesis editorial; ampliar lectura · por verificar

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

Síntesis editorial; ampliar lectura · por verificar
#165 · IA APLICADA · EVALUACIÓN

Right Diagnoses, Decorative Reasoning

Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.

Síntesis editorial; ampliar lectura · por verificar
#169 · AGENTES · MODELOS PEQUEÑOS

AgentFold

Señal del scout sobre composición o compactación de agentes.

Síntesis editorial; ampliar lectura · por verificar
#02 · AGENTES · TOOL USE · LATENCIA

OODA-Tool

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#19 · AI SCIENTIST · INTERPRETABILIDAD

Mechanist

Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.

Resultado con fuente enlazada · v1
#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST

ReASearch

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

Resultado con fuente enlazada · v1
#33 · CODE · RETRIEVAL · OPTIMIZACIÓN

RepoOMP

RepoOMP construye un grafo de atributos de rendimiento, enruta hotspots entre reglas deterministas y agente LLM, y compone un contexto estructurado con las dependencias relevantes.

Resultado con fuente enlazada · v1
#35 · SEARCH AGENTS · RL · GENERALIZACIÓN

Cross-Domain Hybrid OPD

El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.

Resultado con fuente enlazada · v1
#42 · RAG · EVALUACIÓN · CODING

ScoreGate

Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.

Resultado con fuente enlazada · v1
#69 · AGENTES · RAG · EVALUACIÓN

DiscoBench

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.

Resultado con fuente enlazada · v2
#103 · AGENTES · RAG

WebSwarm

Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Cuántos errores desaparecen si el agente debe demostrar que leyó antes de razonar?

INPUT: Un conjunto de tareas multi-hop con y sin read-gate y con evidencia obligatoria.

MÉTRICA: exactitud, citas válidas, saltos sin soporte y latencia

REGLA DE PARADA: Parar si el gate sólo aumenta latencia sin reducir afirmaciones no soportadas.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP