NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Incertidumbre y abstención operable

Un sistema útil explicita cuándo no tiene fuente, no puede responder o necesita una decisión humana antes de continuar.

POR QUÉ APARECE

Aparece en 53 documentos, 39 papers y 10 semanas; conecta 9 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD6/10
CONEXIÓN10/10
DOCUMENTOS53
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#48 · RAG · CODING

Code Is More Than Text

Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.

Resultado con fuente enlazada · v1
#51 · MODELOS PEQUEÑOS

Atomic Intent Reasoning

AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.

Resultado con fuente enlazada · v1
#68 · MEMORIA · AGENTES

Supersede

Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded.

Resultado con fuente enlazada · v1
#82 · IA APLICADA · EVALUACIÓN

From Signals to Transfer

Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.

Resultado con fuente enlazada · v1
#94 · AGENTES · RAG · CODING

UA-ChatDev

Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.

Resultado con fuente enlazada · v1

Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo. En razonamiento matemático y red-teaming, un diseño simple compite con monitores de hypothesis testing secuencial.

Resultado con fuente enlazada · v1
#113 · MEMORIA · AGENTES · RAG

SearchOS-V1

Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.

Resultado con fuente enlazada · v1
#122 · AGENTES · EVALUACIÓN

AgentCheck

Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.

Resultado con fuente enlazada · v3

Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.

Resultado con fuente enlazada · v1

SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.

Resultado con fuente enlazada · v1

Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.

Resultado con fuente enlazada · v1
#135 · MULTIMODAL · MODELOS PEQUEÑOS

Scaling Native Multimodal Pre-Training From Scratch

Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.

Resultado con fuente enlazada · v1
#147 · AGENTES · RAG · EVALUACIÓN

WorkSurface-Bench

Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.

Resultado con fuente enlazada · v1
#152 · MEMORIA · AGENTES · MODELOS PEQUEÑOS

NeSyFS

Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.

Resultado con fuente enlazada · v2
#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT

LiveMem

LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.

Resultado con fuente enlazada · v2
#02 · AGENTES · TOOL USE · LATENCIA

OODA-Tool

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#04 · RAG · RETRIEVAL · DECISIÓN

MetaRAG

MetaRAG formula la generación aumentada como una política adaptativa con Verify-first Action Generation e Internal Belief Probing durante el entrenamiento.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#05 · RAG · ABSTENCIÓN · EVALUACIÓN

The RAT

The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#165 · IA APLICADA · EVALUACIÓN

Right Diagnoses, Decorative Reasoning

Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.

Síntesis editorial; ampliar lectura · por verificar
#01 · AGENTES · MÓVIL · EVALUACIÓN

MobilePA-Bench

MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.

Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026
#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD

SPA

SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.

Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026
#07 · RAG · EVIDENCIA · TRAZABILIDAD

ClueWeaver

ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#08 · AGENTES · SERVING · SISTEMAS

TOPAS

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026
#19 · AI SCIENTIST · INTERPRETABILIDAD

Mechanist

Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.

Resultado con fuente enlazada · v1
#32 · WORLD MODELS · MEMORIA · PLANIFICACIÓN

MemWM

MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.

Resultado con fuente enlazada · v1
#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS

MNC

MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.

Resultado con fuente enlazada · v1
#146 · AGENTES · SEGURIDAD · CODING

SkillGate

SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.

Resultado con fuente enlazada · v1
#159 · AGENTES · EVALUACIÓN · CODING

SWE Refactor Bench

Señal del scout sobre evaluación de refactors de software por agentes.

Síntesis editorial; ampliar lectura · por verificar
#161 · AGENTES · RAG

CAFE

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

Síntesis editorial; ampliar lectura · por verificar

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

Síntesis editorial; ampliar lectura · por verificar
#163 · AGENTES · SEGURIDAD · MULTIMODAL

StepGuard

Señal del scout sobre compuertas de seguridad a nivel de paso.

Síntesis editorial; ampliar lectura · por verificar
#164 · AGENTES · EVALUACIÓN

RACE

Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.

Síntesis editorial; ampliar lectura · por verificar
#166 · IA APLICADA · EVALUACIÓN

AsymSpec

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

Síntesis editorial; ampliar lectura · por verificar
#167 · AGENTES · SEGURIDAD

When Tool Outputs Become Commands

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

Síntesis editorial; ampliar lectura · por verificar
#168 · AGENTES

WikiSkill

Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.

Síntesis editorial; ampliar lectura · por verificar
#169 · AGENTES · MODELOS PEQUEÑOS

AgentFold

Señal del scout sobre composición o compactación de agentes.

Síntesis editorial; ampliar lectura · por verificar
SIGUIENTE EXPERIMENTO

¿La abstención correcta reduce más riesgo que una respuesta de baja confianza?

INPUT: Tareas con fuentes incompletas, políticas de no respuesta y opciones de escalado.

MÉTRICA: abstención correcta, falsos positivos, cobertura útil y tiempo hasta resolución

REGLA DE PARADA: Parar si el agente se abstiene ante casos resolubles o responde sin declarar el hueco.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP