NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Runtime assurance mediante trazas

Las trazas de ejecución permiten detectar desviaciones, explicar intervenciones y actualizar procedimientos sin esconder el fallo.

POR QUÉ APARECE

Aparece en 17 documentos, 11 papers y 10 semanas; conecta 6 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD4/10
CONEXIÓN7/10
DOCUMENTOS17
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#50 · IA APLICADA · EVALUACIÓN

Mind your key

Estudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.

Resultado con fuente enlazada · v3
#54 · MEMORIA · AGENTES

Multi-Agent Transactive Memory

Propone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.

Resultado con fuente enlazada · v1
#69 · AGENTES · RAG · EVALUACIÓN

DiscoBench

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.

Resultado con fuente enlazada · v2
#85 · AGENTES · RAG

TRIAGE

Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.

Resultado con fuente enlazada · v3

Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.

Resultado con fuente enlazada · v1

En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.

Resultado con fuente enlazada · v2
#145 · MEMORIA · AGENTES

Aries

Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial.

Resultado con fuente enlazada · v1
#14 · SKILLS · FIABILIDAD · RUNTIME

SkillSentry

SkillSentry transforma un skill y trazas previas en una guía de runtime, monitoriza la ejecución y la actualiza con nuevas evidencias. El objetivo no es mejorar la prosa del procedimiento, sino su cumplimiento.

Resultado con fuente enlazada · v1
#163 · AGENTES · SEGURIDAD · MULTIMODAL

StepGuard

Señal del scout sobre compuertas de seguridad a nivel de paso.

Síntesis editorial; ampliar lectura · por verificar
#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES

Teaching Nemotron Greek

El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.

Resultado con fuente enlazada · v1
#116 · AGENTES · EVALUACIÓN

AgentCompass

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

Resultado con fuente enlazada · v3
SIGUIENTE EXPERIMENTO

¿Qué desviaciones deben activar una intervención y cuáles son una mejora legítima del procedimiento?

INPUT: Trazas de tareas repetidas con pasos esperados, omitidos, corregidos y resultado.

MÉTRICA: éxito, variabilidad, intervenciones necesarias y tiempo de diagnóstico

REGLA DE PARADA: Parar si la monitorización no puede explicar por qué intervino o añade más latencia que el beneficio.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP