NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

La política como interfaz de ejecución

Permisos, consentimiento, restricciones y objetivos se vuelven una superficie que el agente debe interpretar y el sistema debe validar.

POR QUÉ APARECE

Aparece en 50 documentos, 33 papers y 11 semanas; conecta 9 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN10/10
DOCUMENTOS50
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#45 · AGENTES · EVALUACIÓN · SEGURIDAD

MAStrike

Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.

Resultado con fuente enlazada · v2
#48 · RAG · CODING

Code Is More Than Text

Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.

Resultado con fuente enlazada · v1
#53 · AGENTES · RAG · EVALUACIÓN

ORAgentBench

Benchmark ejecutable para evaluar agentes en tareas reales de investigación operativa: briefs en lenguaje natural, datos multiarchivo, configuraciones y un esquema de entrega validable.

Resultado con fuente enlazada · v1
#64 · EVALUACIÓN

BIM-Edit

Benchmark para edición de modelos BIM/IFC con instrucciones en lenguaje natural; contiene 324 tareas en 11 modelos reales y 36 escenas sintéticas.

Resultado con fuente enlazada · v3
#71 · MODELOS PEQUEÑOS

KG2Cypher

Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.

Resultado con fuente enlazada · v1
#83 · MEMORIA · CODING

Program-as-Weights

Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local.

Resultado con fuente enlazada · v1
#84 · MEMORIA · AGENTES · SEGURIDAD

Distributed Attacks in Persistent-State AI Control

Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.

Resultado con fuente enlazada · v2
#101 · AGENTES · RAG

Multi-Agent AI Control

Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.

Resultado con fuente enlazada · v1

Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.

Resultado con fuente enlazada · v1
#109 · MEMORIA · MODELOS PEQUEÑOS

MORES

Divide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.

Resultado con fuente enlazada · v1
#114 · AGENTES · SEGURIDAD

SEED

Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.

Resultado con fuente enlazada · v1
#116 · AGENTES · EVALUACIÓN

AgentCompass

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

Resultado con fuente enlazada · v3

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.

Resultado con fuente enlazada · v3
#121 · SEGURIDAD · MULTIMODAL

OvisOCR2 Technical Report

Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.

Resultado con fuente enlazada · v1

Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

Resultado con fuente enlazada · v1

Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.

Resultado con fuente enlazada · v1

En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.

Resultado con fuente enlazada · v1

Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker. Introduce una aproximación diferenciable a estos objetivos y proyección de gradientes para reducir conflictos entre relevancia personal y sostenibilidad.

Resultado con fuente enlazada · v1
#146 · AGENTES · SEGURIDAD · CODING

SkillGate

SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.

Resultado con fuente enlazada · v1

Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.

Resultado con fuente enlazada · v2
#156 · MEMORIA · AGENTES · SEGURIDAD

EasyBCI Agent

Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos. Después, un agente ejecutor genera y corrige el pipeline de preprocesamiento hasta superar controles de calidad.

Resultado con fuente enlazada · v2
#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST

ReASearch

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

Resultado con fuente enlazada · v1
#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA

NiyamAI

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

Resultado con fuente enlazada · v1
#10 · AGENTES · CODING · HARNESS

The Devil Is in the Interface

El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.

Resultado con fuente enlazada · v1
#11 · SLM · SKILLS · RL

SKILLER

SKILLER usa un modelo fuerte como actor y crítico para generar skills adaptados al ejecutor pequeño. La señal de aprendizaje viaja en lenguaje natural y no exige modificar directamente el modelo executor.

Resultado con fuente enlazada · v1
#12 · AGENTES · APIs · RAG · EVALUACIÓN

VAKRA

VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.

Resultado con fuente enlazada · v1
#17 · RANKING · RECOMMENDACIÓN · SLM

MetaStrategy

MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.

Resultado con fuente enlazada · v1
#19 · AI SCIENTIST · INTERPRETABILIDAD

Mechanist

Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.

Resultado con fuente enlazada · v1
#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN

VibeLifeBench

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

Resultado con fuente enlazada · v1
#03 · AGENTES · GUI · SEGURIDAD

AnTrap

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD

SPA

SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.

Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026
#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS

MNC

MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué parte de una política debe interpretar el modelo y qué parte debe ejecutar un validador determinista?

INPUT: Políticas en lenguaje natural compiladas a un contrato verificable de acciones.

MÉTRICA: violaciones, falsos bloqueos, trazabilidad y latencia de validación

REGLA DE PARADA: Parar si una política no puede producir una razón auditable por cada decisión.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP