NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Software generativo como workflow

El trabajo de código se desplaza de completar fragmentos a navegar repositorios, decidir cambios, verificar y medir el resultado.

POR QUÉ APARECE

Aparece en 88 documentos, 63 papers y 11 semanas; conecta 9 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN10/10
DOCUMENTOS88
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#38 · AGENTES · EVALUACIÓN · CODING

Workflow-GYM

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

Resultado con fuente enlazada · v4
#39 · AGENTES · SEGURIDAD · MULTIMODAL

Minim

MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.

Resultado con fuente enlazada · v1
#41 · MEMORIA

REAL

Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.

Resultado con fuente enlazada · v1
#42 · RAG · EVALUACIÓN · CODING

ScoreGate

Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.

Resultado con fuente enlazada · v1
#44 · AGENTES · EVALUACIÓN · CODING

Claw-SWE-Bench

Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.

Resultado con fuente enlazada · v1
#48 · RAG · CODING

Code Is More Than Text

Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.

Resultado con fuente enlazada · v1
#58 · AGENTES · EVALUACIÓN

Beyond Static Leaderboards

Evalúa si los benchmarks de agentes predicen desempeño fuera de la muestra, no solo rankings estáticos.

Resultado con fuente enlazada · v1
#67 · EVALUACIÓN

CombEval

Framework para evaluar conteo combinatorio en LLMs.

Resultado con fuente enlazada · v1
#69 · AGENTES · RAG · EVALUACIÓN

DiscoBench

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.

Resultado con fuente enlazada · v2
#74 · AGENTES · RAG · EVALUACIÓN

Ko-WideSearch

Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.

Resultado con fuente enlazada · v1

Método training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos. En LongMemEval con Qwen3-4B logra 64,6% de accuracy usando solo 1/4 de capas full-attention, reduciendo coste frente a baselines.

Resultado con fuente enlazada · v1
#82 · IA APLICADA · EVALUACIÓN

From Signals to Transfer

Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.

Resultado con fuente enlazada · v1
#84 · MEMORIA · AGENTES · SEGURIDAD

Distributed Attacks in Persistent-State AI Control

Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.

Resultado con fuente enlazada · v2
#85 · AGENTES · RAG

TRIAGE

Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.

Resultado con fuente enlazada · v3
#86 · AGENTES · EVALUACIÓN

ReContext

Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.

Resultado con fuente enlazada · v1
#88 · IA APLICADA · EVALUACIÓN

RaBitQCache

Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.

Resultado con fuente enlazada · v1
#94 · AGENTES · RAG · CODING

UA-ChatDev

Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.

Resultado con fuente enlazada · v1
#96 · AGENTES · EVALUACIÓN · CODING

A²utoLPBench

Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.

Resultado con fuente enlazada · v1
#101 · AGENTES · RAG

Multi-Agent AI Control

Estudia ataques coordinados en los que varios agentes reparten una acción maliciosa entre diferentes tareas. Introduce FakeLab, un entorno con nueve servicios, 86 tareas benignas y cuatro objetivos de ataque. El resultado principal es el “efecto de fragmentación”: al aumentar el número de atacantes, disminuye la probabilidad de que un monitor por instancia detecte alguno.

Resultado con fuente enlazada · v1
#102 · AGENTES · EVALUACIÓN · MULTIMODAL

SWE-Review

Añade una etapa de revisión agentic al flujo de resolución de issues. Un agente explora el repositorio, determina si el PR debería aceptarse y emite feedback estructurado para que otro agente revise el parche. Introduce SWE-Review-Bench y SWE-Review-Traj.

Resultado con fuente enlazada · v1
#103 · AGENTES · RAG

WebSwarm

Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.

Resultado con fuente enlazada · v1
#105 · RAG

DynaKRAG

Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.

Resultado con fuente enlazada · v1
#109 · MEMORIA · MODELOS PEQUEÑOS

MORES

Divide el razonamiento latente entre dispositivos móviles y servidores. Un controlador ajusta dinámicamente cuántas iteraciones de razonamiento ejecutar y cuánta información transmitir según la calidad de la red y la dificultad de la tarea.

Resultado con fuente enlazada · v1
#115 · IA APLICADA · EVALUACIÓN

Ring-Zero

Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.

Resultado con fuente enlazada · v2
#117 · MEMORIA · AGENTES · MULTIMODAL

PalmClaw

En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

Resultado con fuente enlazada · v1
#119 · AGENTES

LongStraw

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

Resultado con fuente enlazada · v3
#120 · AGENTES

Harness Handbook

Trata el harness agentic como un objeto de ingeniería de primera clase. El comportamiento de prompts, estado, tools y coordinación suele estar distribuido por grandes repositorios; el trabajo busca hacerlo navegable y editable según comportamientos, no simplemente según archivos.

Resultado con fuente enlazada · v1

Cada comentario de revisión aceptado se transforma en una regla persistente y versionada que el agente debe comprobar en futuras sesiones. En un entorno real de más de 35 microservicios, el sistema acumuló reglas de comportamiento, estándares por lenguaje y una checklist de auto-revisión.

Resultado con fuente enlazada · v1

Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.

Resultado con fuente enlazada · v1

Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.

Resultado con fuente enlazada · v1

En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.

Resultado con fuente enlazada · v1

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

Resultado con fuente enlazada · v2

Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani. Agentes separados extraen requisitos de seguridad, generan especificaciones, hacen prechecks y verifican/refinan los candidatos. Logra especificaciones verificables en 88,9% de funciones con ground truth y 71,4% sin él.

Resultado con fuente enlazada · v1
#143 · MEMORIA · AGENTES · EVALUACIÓN

TransMem

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

Resultado con fuente enlazada · v1

Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales.

Resultado con fuente enlazada · v2
#153 · AGENTES · RAG

RecHarness

Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.

Resultado con fuente enlazada · v1

Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor. La autorización no depende de que la explicación del modelo “suene razonable”, sino de claims verificables sobre objetivo, parámetros y contexto.

Resultado con fuente enlazada · v2
#155 · AGENTES · RAG · EVALUACIÓN

TraceCoder

Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión. Añade identificadores estables para seguir snippets aunque las líneas circundantes cambien.

Resultado con fuente enlazada · v1
#25 · CODING AGENTS · RETRIEVAL · RL

CodeGrep

CodeGrep es un agente de retrieval de 14B que coordina grep, glob y lectura multi-turn para devolver candidatos a un agente de código congelado.

Resultado con fuente enlazada · v1
#26 · RAG · INFRAESTRUCTURA · EFICIENCIA

RAG-Stack

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

Resultado con fuente enlazada · v1
#28 · REASONING · OPTIMIZACIÓN · AI SCIENTIST

ReASearch

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

Resultado con fuente enlazada · v1
#33 · CODE · RETRIEVAL · OPTIMIZACIÓN

RepoOMP

RepoOMP construye un grafo de atributos de rendimiento, enruta hotspots entre reglas deterministas y agente LLM, y compone un contexto estructurado con las dependencias relevantes.

Resultado con fuente enlazada · v1
#35 · SEARCH AGENTS · RL · GENERALIZACIÓN

Cross-Domain Hybrid OPD

El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.

Resultado con fuente enlazada · v1
#16 · RECOVERY · REASONING · AGENTES

Diagnosis Before Recovery

El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.

Resultado con fuente enlazada · v1
#19 · AI SCIENTIST · INTERPRETABILIDAD

Mechanist

Mechanist automatiza un ciclo de hipótesis, experimento, verificación e iteración para investigación de interpretabilidad. Combina un grafo específico de unos 13.000 papers con una base interdisciplinar de gran escala.

Resultado con fuente enlazada · v1
#20 · MULTIMODAL · SAE · CONTROL

MMDiff

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

Resultado con fuente enlazada · v1
#06 · AGENTES · PLANIFICACIÓN · SEGURIDAD

SPA

SPA usa un DSL declarativo y un control de flujo de información de doble retícula para etiquetar artefactos y restringir qué datos pueden llegar a qué acciones.

Resultado con fuente enlazada · arXiv v1 · 27 agosto 2026
#08 · AGENTES · SERVING · SISTEMAS

TOPAS

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026
#159 · AGENTES · EVALUACIÓN · CODING

SWE Refactor Bench

Señal del scout sobre evaluación de refactors de software por agentes.

Síntesis editorial; ampliar lectura · por verificar

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

Síntesis editorial; ampliar lectura · por verificar
#163 · AGENTES · SEGURIDAD · MULTIMODAL

StepGuard

Señal del scout sobre compuertas de seguridad a nivel de paso.

Síntesis editorial; ampliar lectura · por verificar
#164 · AGENTES · EVALUACIÓN

RACE

Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.

Síntesis editorial; ampliar lectura · por verificar
#166 · IA APLICADA · EVALUACIÓN

AsymSpec

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

Síntesis editorial; ampliar lectura · por verificar
#168 · AGENTES

WikiSkill

Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.

Síntesis editorial; ampliar lectura · por verificar
#169 · AGENTES · MODELOS PEQUEÑOS

AgentFold

Señal del scout sobre composición o compactación de agentes.

Síntesis editorial; ampliar lectura · por verificar
#10 · AGENTES · CODING · HARNESS

The Devil Is in the Interface

El estudio compara seis arquitecturas de herramientas sobre 11.700 trayectorias. Las interfaces estructuradas mejoran la consistencia hasta 4,7×; algunas configuraciones reducen pasos y tokens sin perder rendimiento.

Resultado con fuente enlazada · v1
#29 · MEMORIA INTRÍNSECA · LONG-CONTEXT

LiveMem

LiveMem mantiene un estado de memoria de capacidad fija cuya vida es independiente de la ventana KV activa, de forma que el modelo puede seguir usando información cuyos tokens originales ya fueron liberados.

Resultado con fuente enlazada · v2
#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA

NiyamAI

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

Resultado con fuente enlazada · v1
#40 · RAG · EVALUACIÓN · SEGURIDAD

FactoryLLM

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.

Resultado con fuente enlazada · v1
#106 · MEMORIA

MILES

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

Resultado con fuente enlazada · v1
#111 · AGENTES · EVALUACIÓN

LongMedBench

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

Resultado con fuente enlazada · v2
SIGUIENTE EXPERIMENTO

¿Qué evidencia del repositorio reduce más los pasos y el coste sin perder corrección?

INPUT: Issues reales con y sin contexto estructurado, recuperación y verificación de patch.

MÉTRICA: issues resueltos, rondas, tokens, regresiones y tiempo de revisión

REGLA DE PARADA: Parar si el ahorro de tokens aumenta parches incorrectos o deuda de revisión.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP