PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#40 · RAG · EVALUACIÓN · SEGURIDAD Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.
Resultado con fuente enlazada · v1#44 · AGENTES · EVALUACIÓN · CODING Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.
Resultado con fuente enlazada · v1#45 · AGENTES · EVALUACIÓN · SEGURIDAD Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.
Resultado con fuente enlazada · v2Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.
Resultado con fuente enlazada · v1#50 · IA APLICADA · EVALUACIÓN Estudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.
Resultado con fuente enlazada · v3Propone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.
Resultado con fuente enlazada · v1#63 · IA APLICADA · EVALUACIÓN Entrena modelos para que sus autoexplicaciones sean consistentes con su comportamiento.
Resultado con fuente enlazada · v1#69 · AGENTES · RAG · EVALUACIÓN Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Resultado con fuente enlazada · v2#73 · AGENTES · EVALUACIÓN Framework para que agentes encarnados aprendan “leyes” de cooperación desde fallos pasados, como hablar solo cuando hace falta o esperar al compañero. Introduce PARTNR-Dialog y mejora tasas de éxito en benchmarks cooperativos.
Resultado con fuente enlazada · v1Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.
Resultado con fuente enlazada · v2#93 · MEMORIA · AGENTES · RAG Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.
Resultado con fuente enlazada · v1Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo. En razonamiento matemático y red-teaming, un diseño simple compite con monitores de hypothesis testing secuencial.
Resultado con fuente enlazada · v1Revisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso. De 650 papers que mencionan LLM-as-a-Judge, solo 33 se centran en estos escenarios; detecta sobreconfianza, resultados inconsistentes y uso habitual de un solo juez.
Resultado con fuente enlazada · v1#110 · EVALUACIÓN · SEGURIDAD · MULTIMODAL Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.
Resultado con fuente enlazada · v1#113 · MEMORIA · AGENTES · RAG Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
Resultado con fuente enlazada · v1#114 · AGENTES · SEGURIDAD Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.
Resultado con fuente enlazada · v1#116 · AGENTES · EVALUACIÓN Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Resultado con fuente enlazada · v3Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Resultado con fuente enlazada · v3Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.
Resultado con fuente enlazada · v1#125 · MEMORIA · AGENTES · RAG AgentFootprint mide cuánto almacenamiento persistente deja realmente un agente: logs, snapshots, conversaciones, checkpoints y trazas. Ejecutar una misma trayectoria en siete frameworks produjo una diferencia de 6,7×, y configuraciones con el mismo 100% de accuracy difirieron hasta 15,7× en bytes retenidos.
Resultado con fuente enlazada · v3Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.
Resultado con fuente enlazada · v1#131 · AGENTES · EVALUACIÓN · CODING Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.
Resultado con fuente enlazada · v1#132 · RAG · EVALUACIÓN · SEGURIDAD TAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.
Resultado con fuente enlazada · v1#144 · AGENTES · RAG · EVALUACIÓN Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales.
Resultado con fuente enlazada · v2Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial.
Resultado con fuente enlazada · v1#147 · AGENTES · RAG · EVALUACIÓN Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
Resultado con fuente enlazada · v1#148 · AGENTES · SEGURIDAD · MULTIMODAL Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.
Resultado con fuente enlazada · v2Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.
Resultado con fuente enlazada · v1#23 · MEMORIA · AGENTES · RETRIEVAL CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.
Resultado con fuente enlazada · v1#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
Resultado con fuente enlazada · v1#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.
Resultado con fuente enlazada · v1#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.
Resultado con fuente enlazada · v1#10 · AGENTES · CODING · HARNESS El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.
Resultado con fuente enlazada · v1#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.
Resultado con fuente enlazada · v1#01 · AGENTES · MÓVIL · EVALUACIÓN MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.
Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026#02 · AGENTES · TOOL USE · LATENCIA OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#05 · RAG · ABSTENCIÓN · EVALUACIÓN The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.
Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026#07 · RAG · EVIDENCIA · TRAZABILIDAD ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#165 · IA APLICADA · EVALUACIÓN Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.
Síntesis editorial; ampliar lectura · por verificar#03 · AGENTES · GUI · SEGURIDAD AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#04 · RAG · RETRIEVAL · DECISIÓN MetaRAG formula la generación aumentada como una política adaptativa con Verify-first Action Generation e Internal Belief Probing durante el entrenamiento.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#08 · AGENTES · SERVING · SISTEMAS TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026#12 · AGENTES · APIs · RAG · EVALUACIÓN VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.
Resultado con fuente enlazada · v1#19 · AI SCIENTIST · INTERPRETABILIDAD Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.
Resultado con fuente enlazada · v1#25 · CODING AGENTS · RETRIEVAL · RL CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.
Resultado con fuente enlazada · v1#27 · AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.
Resultado con fuente enlazada · v2#32 · WORLD MODELS · MEMORIA · PLANIFICACIÓN MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.
Resultado con fuente enlazada · v1Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.
Resultado con fuente enlazada · v1#89 · AGENTES · EVALUACIÓN · SEGURIDAD Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.
Resultado con fuente enlazada · v1Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.
Resultado con fuente enlazada · v1Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.
Resultado con fuente enlazada · v1#167 · AGENTES · SEGURIDAD Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.
Síntesis editorial; ampliar lectura · por verificar