PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#45 · AGENTES · EVALUACIÓN · SEGURIDAD Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.
Resultado con fuente enlazada · v2Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.
Resultado con fuente enlazada · v1#53 · AGENTES · RAG · EVALUACIÓN Benchmark ejecutable para evaluar agentes en tareas reales de investigación operativa: briefs en lenguaje natural, datos multiarchivo, configuraciones y un esquema de entrega validable.
Resultado con fuente enlazada · v1#56 · AGENTES · SEGURIDAD Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.
Resultado con fuente enlazada · v1Benchmark para edición de modelos BIM/IFC con instrucciones en lenguaje natural; contiene 324 tareas en 11 modelos reales y 36 escenas sintéticas.
Resultado con fuente enlazada · v3Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.
Resultado con fuente enlazada · v1Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local.
Resultado con fuente enlazada · v1#84 · MEMORIA · AGENTES · SEGURIDAD Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.
Resultado con fuente enlazada · v2Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.
Resultado con fuente enlazada · v1Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.
Resultado con fuente enlazada · v1#109 · MEMORIA · MODELOS PEQUEÑOS Divide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.
Resultado con fuente enlazada · v1#114 · AGENTES · SEGURIDAD Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.
Resultado con fuente enlazada · v1#116 · AGENTES · EVALUACIÓN Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Resultado con fuente enlazada · v3Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Resultado con fuente enlazada · v3#121 · SEGURIDAD · MULTIMODAL Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.
Resultado con fuente enlazada · v1#123 · MEMORIA · AGENTES · MULTIMODAL Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.
Resultado con fuente enlazada · v1Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.
Resultado con fuente enlazada · v1En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.
Resultado con fuente enlazada · v1#142 · IA APLICADA · EVALUACIÓN Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker. Introduce una aproximación diferenciable a estos objetivos y proyección de gradientes para reducir conflictos entre relevancia personal y sostenibilidad.
Resultado con fuente enlazada · v1#146 · AGENTES · SEGURIDAD · CODING SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.
Resultado con fuente enlazada · v1#154 · AGENTES · SEGURIDAD Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.
Resultado con fuente enlazada · v2#156 · MEMORIA · AGENTES · SEGURIDAD Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos. Después, un agente ejecutor genera y corrige el pipeline de preprocesamiento hasta superar controles de calidad.
Resultado con fuente enlazada · v2#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.
Resultado con fuente enlazada · v1#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
Resultado con fuente enlazada · v1#10 · AGENTES · CODING · HARNESS El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.
Resultado con fuente enlazada · v1SKILLER usa un modelo fuerte como actor y crítico para generar skills adaptados al ejecutor pequeño. La señal de aprendizaje viaja en lenguaje natural y no exige modificar directamente el modelo executor.
Resultado con fuente enlazada · v1#12 · AGENTES · APIs · RAG · EVALUACIÓN VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.
Resultado con fuente enlazada · v1#17 · RANKING · RECOMMENDACIÓN · SLM MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.
Resultado con fuente enlazada · v1#19 · AI SCIENTIST · INTERPRETABILIDAD Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.
Resultado con fuente enlazada · v1#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.
Resultado con fuente enlazada · v1#03 · AGENTES · GUI · SEGURIDAD AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.
Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.
Resultado con fuente enlazada · v1