NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

La interfaz como parte del modelo

La arquitectura de herramientas, el harness y el formato de interacción cambian la inteligencia efectiva del agente.

POR QUÉ APARECE

Aparece en 60 documentos, 39 papers y 11 semanas; conecta 9 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD4/10
CONEXIÓN10/10
DOCUMENTOS60
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#38 · AGENTES · EVALUACIÓN · CODING

Workflow-GYM

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

Resultado con fuente enlazada · v4
#39 · AGENTES · SEGURIDAD · MULTIMODAL

Minim

MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.

Resultado con fuente enlazada · v1
#50 · IA APLICADA · EVALUACIÓN

Mind your key

Estudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.

Resultado con fuente enlazada · v3
#59 · IA APLICADA · EVALUACIÓN

Variable-Width Transformers

Explora Transformers cuyo ancho varía por capa, en vez de mantener la misma dimensión en todo el modelo.

Resultado con fuente enlazada · v1
#64 · EVALUACIÓN

BIM-Edit

Benchmark para edición de modelos BIM/IFC con instrucciones en lenguaje natural; contiene 324 tareas en 11 modelos reales y 36 escenas sintéticas.

Resultado con fuente enlazada · v3
#89 · AGENTES · EVALUACIÓN · SEGURIDAD

EvoPolicyGym

Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.

Resultado con fuente enlazada · v1

Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro.

Resultado con fuente enlazada · v1
#100 · AGENTES · CODING

TTHE

Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.

Resultado con fuente enlazada · v1
#103 · AGENTES · RAG

WebSwarm

Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.

Resultado con fuente enlazada · v1

Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.

Resultado con fuente enlazada · v1
#115 · IA APLICADA · EVALUACIÓN

Ring-Zero

Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.

Resultado con fuente enlazada · v2
#117 · MEMORIA · AGENTES · MULTIMODAL

PalmClaw

En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

Resultado con fuente enlazada · v1
#120 · AGENTES

Harness Handbook

Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.

Resultado con fuente enlazada · v1
#125 · MEMORIA · AGENTES · RAG

The Hidden Footprint

AgentFootprint mide cuánto almacenamiento persistente deja realmente un agente: logs, snapshots, conversaciones, checkpoints y trazas. Ejecutar una misma trayectoria en siete frameworks produjo una diferencia de 6,7×, y configuraciones con el mismo 100% de accuracy difirieron hasta 15,7× en bytes retenidos.

Resultado con fuente enlazada · v3

Añade pequeños cabezales que leen los estados latentes de un LLM/VLM congelado para decidir cosas como continuar razonando, escalar a un modelo superior, pedir información, usar una herramienta o abstenerse.

Resultado con fuente enlazada · v1

En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.

Resultado con fuente enlazada · v2

Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales. Pone en el centro verificabilidad, trazabilidad, robustez frente a alucinaciones y coste computacional.

Resultado con fuente enlazada · v1

Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.

Resultado con fuente enlazada · v2
#155 · AGENTES · RAG · EVALUACIÓN

TraceCoder

Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión. Añade identificadores estables para seguir snippets aunque las líneas circundantes cambien.

Resultado con fuente enlazada · v1
#24 · SLM · MEMORIA · TOOL-USE

Agent Memory Distillation

AMD construye memorias de Workflow, Subtask y Function a partir de trayectorias exitosas de un agente profesor; las dos primeras se inyectan al comenzar y la tercera aparece cuando falla una llamada a herramienta.

Resultado con fuente enlazada · v1
#26 · RAG · INFRAESTRUCTURA · EFICIENCIA

RAG-Stack

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

Resultado con fuente enlazada · v1
#31 · DISCOVERY · RECOMENDACIÓN · AGENTES

Shape Your Feed

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

Resultado con fuente enlazada · v1
#10 · AGENTES · CODING · HARNESS

The Devil Is in the Interface

El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.

Resultado con fuente enlazada · v1
#02 · AGENTES · TOOL USE · LATENCIA

OODA-Tool

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026
#03 · AGENTES · GUI · SEGURIDAD

AnTrap

AnTrap amplía 116 escenarios originales hasta 236 tareas con anomalías en estado, pensamiento, acción y ronda, y evalúa 16 modelos GUI.

Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026
#08 · AGENTES · SERVING · SISTEMAS

TOPAS

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026
#161 · AGENTES · RAG

CAFE

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

Síntesis editorial; ampliar lectura · por verificar
#166 · IA APLICADA · EVALUACIÓN

AsymSpec

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

Síntesis editorial; ampliar lectura · por verificar
#167 · AGENTES · SEGURIDAD

When Tool Outputs Become Commands

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

Síntesis editorial; ampliar lectura · por verificar
#20 · MULTIMODAL · SAE · CONTROL

MMDiff

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

Resultado con fuente enlazada · v1
#23 · MEMORIA · AGENTES · RETRIEVAL

CoEvo-Mem

CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.

Resultado con fuente enlazada · v1
#44 · AGENTES · EVALUACIÓN · CODING

Claw-SWE-Bench

Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.

Resultado con fuente enlazada · v1
#74 · AGENTES · RAG · EVALUACIÓN

Ko-WideSearch

Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.

Resultado con fuente enlazada · v1
#83 · MEMORIA · CODING

Program-as-Weights

Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local.

Resultado con fuente enlazada · v1
#116 · AGENTES · EVALUACIÓN

AgentCompass

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

Resultado con fuente enlazada · v3

Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

Resultado con fuente enlazada · v1

Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.

Resultado con fuente enlazada · v1
#147 · AGENTES · RAG · EVALUACIÓN

WorkSurface-Bench

Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes. Incluye 1.151 tareas atómicas y 27.624 trayectorias sobre seis configuraciones de agente.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué cambia más el resultado: el modelo o el diseño de sus herramientas?

INPUT: Dos versiones del mismo workflow con idéntico modelo y tool surface distinta.

MÉTRICA: éxito por tarea, pasos, tokens y errores de herramienta

REGLA DE PARADA: Parar si la diferencia no supera el ruido de repetición o si la interfaz añade más coste que valor.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP