PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#38 · AGENTES · EVALUACIÓN · CODING Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
Resultado con fuente enlazada · v4#43 · RAG · EVALUACIÓN · MULTIMODAL Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.
Resultado con fuente enlazada · v1#47 · AGENTES · SEGURIDAD · MULTIMODAL Método RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.
Resultado con fuente enlazada · v1Propone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.
Resultado con fuente enlazada · v1Mantiene la respuesta de un profesor fuerte dentro del prompt, no dentro del gradiente, para evitar drift en RL/distillation.
Resultado con fuente enlazada · v1#70 · RAG · EVALUACIÓN · MODELOS PEQUEÑOS Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.
Resultado con fuente enlazada · v1#72 · MEMORIA · SEGURIDAD Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.
Resultado con fuente enlazada · v2#74 · AGENTES · RAG · EVALUACIÓN Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.
Resultado con fuente enlazada · v1Método training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos. En LongMemEval con Qwen3-4B logra 64,6% de accuracy usando solo 1/4 de capas full-attention, reduciendo coste frente a baselines.
Resultado con fuente enlazada · v1#77 · IA APLICADA · EVALUACIÓN Scheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto. Reporta 1,15x de speedup frente a Hydra y pico de 1,36x frente a Medusa.
Resultado con fuente enlazada · v1Estudia cómo seleccionar datasets que preserven rankings de modelos. El listado de arXiv lo marca aceptado en KDD 2026.
Resultado con fuente enlazada · v1#87 · AGENTES · EVALUACIÓN Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas. En 14 modelos, 4 benchmarks agentic y 19 no-agentic, logra MAE menor del 4%, Spearman >0.80 y ranking accuracy \~85% con menos del 1% del coste.
Resultado con fuente enlazada · v2Entrena modelos a descomponer código en subfunciones recombinables. Recombinar k implementaciones de n módulos genera hasta k^n soluciones candidatas, desplazando coste de GPU a evaluación CPU y reduciendo coste de tokens \~50x.
Resultado con fuente enlazada · v1#94 · AGENTES · RAG · CODING Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.
Resultado con fuente enlazada · v1Revisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso. De 650 papers que mencionan LLM-as-a-Judge, solo 33 se centran en estos escenarios; detecta sobreconfianza, resultados inconsistentes y uso habitual de un solo juez.
Resultado con fuente enlazada · v1Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.
Resultado con fuente enlazada · v1#115 · IA APLICADA · EVALUACIÓN Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.
Resultado con fuente enlazada · v2Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.
Resultado con fuente enlazada · v1Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.
Resultado con fuente enlazada · v1En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.
Resultado con fuente enlazada · v1LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos. Combina SFT general, RL general, entrenamiento embodied y model merging. Mantiene rendimiento cercano a Qwen3-8B thinking en capacidades generales con respuestas mucho más cortas y supera a varios modelos considerablemente mayores en benchmarks embodied zero-shot.
Resultado con fuente enlazada · v2#139 · AGENTES · SEGURIDAD Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani. Agentes separados extraen requisitos de seguridad, generan especificaciones, hacen prechecks y verifican/refinan los candidatos. Logra especificaciones verificables en 88,9% de funciones con ground truth y 71,4% sin él.
Resultado con fuente enlazada · v1Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales. Pone en el centro verificabilidad, trazabilidad, robustez frente a alucinaciones y coste computacional.
Resultado con fuente enlazada · v1#156 · MEMORIA · AGENTES · SEGURIDAD Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos. Después, un agente ejecutor genera y corrige el pipeline de preprocesamiento hasta superar controles de calidad.
Resultado con fuente enlazada · v2#24 · SLM · MEMORIA · TOOL-USE AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.
Resultado con fuente enlazada · v1#25 · CODING AGENTS · RETRIEVAL · RL CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.
Resultado con fuente enlazada · v1#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.
Resultado con fuente enlazada · v1SKILLER usa un modelo fuerte como actor y crítico para generar skills adaptados al ejecutor pequeño. La señal de aprendizaje viaja en lenguaje natural y no exige modificar directamente el modelo executor.
Resultado con fuente enlazada · v1Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.
Resultado con fuente enlazada · v1#108 · MULTIMODAL · MODELOS PEQUEÑOS Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.
Resultado con fuente enlazada · v1#123 · MEMORIA · AGENTES · MULTIMODAL Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
Resultado con fuente enlazada · v1#135 · MULTIMODAL · MODELOS PEQUEÑOS Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Resultado con fuente enlazada · v1#149 · RAG · EVALUACIÓN · CODING Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía. Reconstruye 665 millones de pares públicos de pretraining, crea 1,88 millones de pares supervisados y extiende el entrenamiento a ocho idiomas.
Resultado con fuente enlazada · v2