PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#38 · AGENTES · EVALUACIÓN · CODING Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
Resultado con fuente enlazada · v4#39 · AGENTES · SEGURIDAD · MULTIMODAL MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.
Resultado con fuente enlazada · v1Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.
Resultado con fuente enlazada · v1#42 · RAG · EVALUACIÓN · CODING Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.
Resultado con fuente enlazada · v1#44 · AGENTES · EVALUACIÓN · CODING Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.
Resultado con fuente enlazada · v1Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.
Resultado con fuente enlazada · v1#58 · AGENTES · EVALUACIÓN Evalúa si los benchmarks de agentes predicen desempeño fuera de la muestra, no solo rankings estáticos.
Resultado con fuente enlazada · v1#66 · IA APLICADA · EVALUACIÓN Explora inferencia estructurada con un enfoque tipo Gibbs alrededor de LLMs.
Resultado con fuente enlazada · v1Framework para evaluar conteo combinatorio en LLMs.
Resultado con fuente enlazada · v1#69 · AGENTES · RAG · EVALUACIÓN Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Resultado con fuente enlazada · v2#74 · AGENTES · RAG · EVALUACIÓN Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.
Resultado con fuente enlazada · v1Método training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos. En LongMemEval con Qwen3-4B logra 64,6% de accuracy usando solo 1/4 de capas full-attention, reduciendo coste frente a baselines.
Resultado con fuente enlazada · v1#82 · IA APLICADA · EVALUACIÓN Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.
Resultado con fuente enlazada · v1#84 · MEMORIA · AGENTES · SEGURIDAD Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.
Resultado con fuente enlazada · v2Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.
Resultado con fuente enlazada · v3#86 · AGENTES · EVALUACIÓN Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.
Resultado con fuente enlazada · v1#88 · IA APLICADA · EVALUACIÓN Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.
Resultado con fuente enlazada · v1#94 · AGENTES · RAG · CODING Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.
Resultado con fuente enlazada · v1#96 · AGENTES · EVALUACIÓN · CODING Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.
Resultado con fuente enlazada · v1Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.
Resultado con fuente enlazada · v1#102 · AGENTES · EVALUACIÓN · MULTIMODAL Añade una etapa de revisión agentic al flujo de resolución de issues. Un agente explora el repositorio, determina si el PR debería aceptarse y emite feedback estructurado para que otro agente revise el parche. Introduce SWE-Review-Bench y SWE-Review-Traj.
Resultado con fuente enlazada · v1Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.
Resultado con fuente enlazada · v1Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.
Resultado con fuente enlazada · v1#109 · MEMORIA · MODELOS PEQUEÑOS Divide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.
Resultado con fuente enlazada · v1#115 · IA APLICADA · EVALUACIÓN Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.
Resultado con fuente enlazada · v2#117 · MEMORIA · AGENTES · MULTIMODAL En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.
Resultado con fuente enlazada · v1Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.
Resultado con fuente enlazada · v3Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.
Resultado con fuente enlazada · v1#123 · MEMORIA · AGENTES · MULTIMODAL Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
Resultado con fuente enlazada · v1Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.
Resultado con fuente enlazada · v1#131 · AGENTES · EVALUACIÓN · CODING Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.
Resultado con fuente enlazada · v1En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.
Resultado con fuente enlazada · v1Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
Resultado con fuente enlazada · v2#139 · AGENTES · SEGURIDAD Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani. Agentes separados extraen requisitos de seguridad, generan especificaciones, hacen prechecks y verifican/refinan los candidatos. Logra especificaciones verificables en 88,9% de funciones con ground truth y 71,4% sin él.
Resultado con fuente enlazada · v1#143 · MEMORIA · AGENTES · EVALUACIÓN TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.
Resultado con fuente enlazada · v1#144 · AGENTES · RAG · EVALUACIÓN Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales.
Resultado con fuente enlazada · v2Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.
Resultado con fuente enlazada · v1#154 · AGENTES · SEGURIDAD Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.
Resultado con fuente enlazada · v2#155 · AGENTES · RAG · EVALUACIÓN Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión. Añade identificadores estables para seguir snippets aunque las líneas circundantes cambien.
Resultado con fuente enlazada · v1#157 · AGENTES · SEGURIDAD Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.
Resultado con fuente enlazada · v1#25 · CODING AGENTS · RETRIEVAL · RL CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.
Resultado con fuente enlazada · v1#26 · RAG · INFRAESTRUCTURA · EFICIENCIA RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.
Resultado con fuente enlazada · v1#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.
Resultado con fuente enlazada · v1#33 · CODE · RETRIEVAL · OPTIMIZACIÓN RepoOMP construye un grafo de atributos de rendimiento, enruta hotspots entre reglas deterministas y agente LLM, y compone un contexto estructurado con las dependencias relevantes.
Resultado con fuente enlazada · v1#35 · SEARCH AGENTS · RL · GENERALIZACIÓN El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.
Resultado con fuente enlazada · v1#16 · RECOVERY · REASONING · AGENTES El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.
Resultado con fuente enlazada · v1#19 · AI SCIENTIST · INTERPRETABILIDAD Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.
Resultado con fuente enlazada · v1#20 · MULTIMODAL · SAE · CONTROL MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.
Resultado con fuente enlazada · v1#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.
Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026#08 · AGENTES · SERVING · SISTEMAS TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026#159 · AGENTES · EVALUACIÓN · CODING Señal del scout sobre evaluación de refactors de software por agentes.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre ceguera a la evidencia en agentes de búsqueda.
Síntesis editorial; ampliar lectura · por verificar#163 · AGENTES · SEGURIDAD · MULTIMODAL Señal del scout sobre compuertas de seguridad a nivel de paso.
Síntesis editorial; ampliar lectura · por verificar#164 · AGENTES · EVALUACIÓN Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.
Síntesis editorial; ampliar lectura · por verificar#166 · IA APLICADA · EVALUACIÓN Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre skills derivadas de conocimiento estructurado o wikis.
Síntesis editorial; ampliar lectura · por verificar#169 · AGENTES · MODELOS PEQUEÑOS Señal del scout sobre composición o compactación de agentes.
Síntesis editorial; ampliar lectura · por verificar#10 · AGENTES · CODING · HARNESS El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.
Resultado con fuente enlazada · v1#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.
Resultado con fuente enlazada · v2#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
Resultado con fuente enlazada · v1#40 · RAG · EVALUACIÓN · SEGURIDAD Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.
Resultado con fuente enlazada · v1Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
Resultado con fuente enlazada · v1#111 · AGENTES · EVALUACIÓN Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.
Resultado con fuente enlazada · v2