PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.
Resultado con fuente enlazada · v1AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.
Resultado con fuente enlazada · v1Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.
Resultado con fuente enlazada · v1Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded.
Resultado con fuente enlazada · v1#82 · IA APLICADA · EVALUACIÓN Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.
Resultado con fuente enlazada · v1#94 · AGENTES · RAG · CODING Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.
Resultado con fuente enlazada · v1Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo. En razonamiento matemático y red-teaming, un diseño simple compite con monitores de hypothesis testing secuencial.
Resultado con fuente enlazada · v1#113 · MEMORIA · AGENTES · RAG Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
Resultado con fuente enlazada · v1#122 · AGENTES · EVALUACIÓN Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.
Resultado con fuente enlazada · v3Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.
Resultado con fuente enlazada · v1SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.
Resultado con fuente enlazada · v1Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.
Resultado con fuente enlazada · v1#135 · MULTIMODAL · MODELOS PEQUEÑOS Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Resultado con fuente enlazada · v1#147 · AGENTES · RAG · EVALUACIÓN Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.
Resultado con fuente enlazada · v1#152 · MEMORIA · AGENTES · MODELOS PEQUEÑOS Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.
Resultado con fuente enlazada · v2#157 · AGENTES · SEGURIDAD Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.
Resultado con fuente enlazada · v1#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.
Resultado con fuente enlazada · v2#02 · AGENTES · TOOL USE · LATENCIA OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#04 · RAG · RETRIEVAL · DECISIÓN MetaRAG formula la generación aumentada como una política adaptativa con Verify-first Action Generation e Internal Belief Probing durante el entrenamiento.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#05 · RAG · ABSTENCIÓN · EVALUACIÓN The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#165 · IA APLICADA · EVALUACIÓN Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.
Síntesis editorial; ampliar lectura · por verificar#01 · AGENTES · MÓVIL · EVALUACIÓN MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.
Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.
Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026#07 · RAG · EVIDENCIA · TRAZABILIDAD ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#08 · AGENTES · SERVING · SISTEMAS TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026#19 · AI SCIENTIST · INTERPRETABILIDAD Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.
Resultado con fuente enlazada · v1#32 · WORLD MODELS · MEMORIA · PLANIFICACIÓN MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.
Resultado con fuente enlazada · v1#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.
Resultado con fuente enlazada · v1#146 · AGENTES · SEGURIDAD · CODING SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.
Resultado con fuente enlazada · v1#159 · AGENTES · EVALUACIÓN · CODING Señal del scout sobre evaluación de refactors de software por agentes.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre generalización extraña y desalineamiento emergente.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre ceguera a la evidencia en agentes de búsqueda.
Síntesis editorial; ampliar lectura · por verificar#163 · AGENTES · SEGURIDAD · MULTIMODAL Señal del scout sobre compuertas de seguridad a nivel de paso.
Síntesis editorial; ampliar lectura · por verificar#164 · AGENTES · EVALUACIÓN Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.
Síntesis editorial; ampliar lectura · por verificar#166 · IA APLICADA · EVALUACIÓN Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.
Síntesis editorial; ampliar lectura · por verificar#167 · AGENTES · SEGURIDAD Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre skills derivadas de conocimiento estructurado o wikis.
Síntesis editorial; ampliar lectura · por verificar#169 · AGENTES · MODELOS PEQUEÑOS Señal del scout sobre composición o compactación de agentes.
Síntesis editorial; ampliar lectura · por verificar