# La capacidad del agente también depende de cómo se verifica.
> Bundle editorial de Research IA · 7—13 SEP 2026. La página es provisional; la evidencia primaria y sus localizadores están separados de las señales pendientes.

## Navegación y estado

- Página humana: https://luiseduardodemiguel.com/research-ia/weeks/2026-09-07
- Archivo de este corte: https://luiseduardodemiguel.com/research-ia/archive?week=2026-09-07
- Run key: weekly-research:2026-09-07:external-v1
- Prompt version: weekly-research-agents-2026-09-14.1
- Fuentes descubiertas: 15
- Claims seleccionados: 21
- Source-pending usado como evidencia: 0

## Pregunta y tesis

¿Qué cambia cuando la evaluación incluye benchmark, memoria, retrieval, interfaz, trazas, tests y coste como partes del mismo sistema?

La evidencia del corte favorece sistemas que convierten verificación, memoria y procedimientos en políticas explícitas; también muestra que cada compuerta puede introducir coste, fragilidad o una falsa sensación de seguridad.

## Cómo leer el corte

El dossier conecta las fuentes antes de enumerarlas. Cada entrada conserva el papel que juega en la síntesis, un hallazgo observado, su frontera y los claims que se pueden abrir en la fuente primaria.

## Ledger de fuentes

### 01 · How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 11 SEP 2026 · arXiv v1
- Área: EVALUACIÓN / RAZONAMIENTO
- Fuente primaria: https://arxiv.org/html/2609.13009v1
- Papel en la síntesis: Audita si un benchmark está midiendo errores del modelo o errores del propio instrumento.
- Hallazgo observado: La auditoría cambia el score y atribuye 148/152 fallos revisados al benchmark o al grader.
- Contribución: Tras la revisión experta, el rendimiento medido cambia sustancialmente y la mayoría de fallos auditados se atribuyen al benchmark o al grader.
- Frontera: Los conjuntos post-audit no son idénticos a los conjuntos originales. La muestra parte principalmente de fallos aparentes y no estima todos los errores.
- Claims verificables:
  - reported-result: Tras validación y reparación experta, GPT-5.6-Sol pasó de 47.28% a 78.66% mean@4 en HLE-Physics y de 61.00% a 87.24% en CMT-Benchmark.
    - Valor: 47.28→78.66%; 61.00→87.24%
    - Baseline: Evaluación pre-audit
    - Setting: Tres modelos; HLE: 202 preguntas originales y 116 retenidas; CMT: 50 originales y 49 retenidas; cuatro intentos.
    - Localizador: [§3, Table 1, filas HLE-Physics y CMT-Benchmark](https://arxiv.org/html/2609.13009v1#S3)
  - reported-result: En tres audit sets públicos, 148 de 152 casos auditados se atribuyeron a errores del benchmark o del grader y 4 a errores del modelo.
    - Valor: 97.37% benchmark/grader; 2.63% modelo
    - Baseline: Casos inicialmente marcados como incorrectos
    - Setting: Subconjuntos condicionados a fallos aparentes de cuatro intentos.
    - Localizador: [§3.1, Sources of Reported Errors, después de Table 1](https://arxiv.org/html/2609.13009v1#S3.SS1)
- Próxima prueba: No extrapolar el resultado a razonamiento físico abierto; repetir con conjuntos retenidos, jueces independientes y tareas no seleccionadas.

### 02 · K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 11 SEP 2026 · arXiv v1
- Área: SEGURIDAD / AGENTES
- Fuente primaria: https://arxiv.org/html/2609.12808v1
- Papel en la síntesis: Comprueba si el olvido medido en pesos cubre también prompt, retrieval, herramientas y trazas.
- Hallazgo observado: Los canales no paramétricos pueden filtrar secretos aunque el probe de pesos indique olvido.
- Contribución: Los secretos no paramétricos pueden filtrarse aunque los probes de pesos parezcan indicar olvido.
- Frontera: El corpus principal usa PII sintética. Los sustratos se evalúan por separado y el scaffold no representa todas las arquitecturas.
- Claims verificables:
  - reported-result: Con secretos en contexto o retrieval, los probes de pesos quedaron cerca de no-memorización, pero Llama-3.1-8B expuso 22.3% en contexto, 60.2% en R-text y 85.5% en R-struct; Qwen3.5-9B llegó a 99.2% en contexto.
    - Valor: 22.3–99.2% según canal y modelo
    - Baseline: TOFU, MUSE, WMDP y LUME como probes paramétricos
    - Setting: Llama-3.1-8B, Qwen3.5-9B y Mistral-7B; seis canales observables.
    - Localizador: [§5.3, Table 5(a–b) y discusión posterior](https://arxiv.org/html/2609.12808v1#S5.SS3)
  - reported-result: En ocho modelos servidos por API, el observador detectó fugas en las 24 combinaciones modelo/sustrato: OR(all) fue 0.270–1.000 en contexto, 0.160–0.710 en R-text y 0.335–0.965 en R-struct.
    - Valor: 24/24 combinaciones con fuga observada
    - Baseline: Sin intervención; probes directos no aplicables a endpoints
    - Setting: Ocho endpoints, tres sustratos no paramétricos y 200 consultas por celda.
    - Localizador: [§5.3, Table 6, The gap widens behind an API](https://arxiv.org/html/2609.12808v1#S5.SS3)
- Próxima prueba: Repetir con sustratos combinados, datos no sintéticos y canales específicos del runtime que se quiera certificar.

### 03 · Beyond Vector Similarity: Hierarchical Context-Aware Graph RAG vs Standard RAG in Enterprise Code Migration

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 11 SEP 2026 · arXiv v1
- Área: RAG / CÓDIGO
- Fuente primaria: https://arxiv.org/html/2609.12464v1
- Papel en la síntesis: Mide si preservar estructura del repositorio mejora la migración más allá de la similitud vectorial.
- Hallazgo observado: La estructura reduce alucinación de API, pero introduce un coste medible en complejidad y docstrings.
- Contribución: Graph RAG mejora alucinación de API y calidad ponderada, pero empeora complejidad y preservación de docstrings en el setting evaluado.
- Frontera: Sólo se estudia un repositorio Java→Python. No hay evidencia estadística de generalización a otras familias de generación.
- Claims verificables:
  - reported-result: Graph RAG redujo la alucinación media de API de 56.4% a 16.2% y elevó la calidad ponderada de migración de 65.5% a 83.2%; CodeBLEU cambió de 90.6% a 91.1%.
    - Valor: 56.4→16.2%; 65.5→83.2%; CodeBLEU 90.6→91.1%
    - Baseline: Standard RAG con chunks de 800, overlap 150 y top-5 cosine retrieval
    - Setting: spring-petclinic-genai; Java→Python; Gemini-2.5-pro; temperatura 0; hasta tres hops AST.
    - Localizador: [§6, Table 1](https://arxiv.org/html/2609.12464v1#S6)
  - reported-result: Graph RAG redujo Cyclomatic Complexity Consistency de 71.6% a 46.7% y Docstring Preservation de 67.0% a 61.0%.
    - Valor: CCC 71.6→46.7%; DP 67.0→61.0%
    - Baseline: Standard RAG en el mismo modelo y repositorio
    - Setting: Misma migración Java→Python, evaluación agregada por archivos.
    - Localizador: [§6, Table 1, filas CCC y DP; §7 trade-offs](https://arxiv.org/html/2609.12464v1#S6)
- Próxima prueba: Repetir sobre varios repositorios y añadir métricas estructurales al criterio de aceptación; no usar CodeBLEU como único indicador.

### 04 · Negative Self-Distillation: Learning to Reason by Avoiding Flaws

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 10 SEP 2026 · arXiv v1
- Área: RAZONAMIENTO / ENTRENAMIENTO
- Fuente primaria: https://arxiv.org/html/2609.11699v1
- Papel en la síntesis: Explora si el modelo puede mejorar alejándose de fallos autogenerados sin soluciones gold.
- Hallazgo observado: El método mejora Qwen3 en matemáticas dentro del protocolo descrito, pero no prueba transferencia fuera de ese dominio.
- Contribución: El método mejora Qwen3 en matemáticas dentro del protocolo descrito, pero no prueba transferencia fuera de ese dominio.
- Frontera: Sólo se evalúa Qwen3. El mejor checkpoint se selecciona dentro de dos épocas y sobre tareas matemáticas.
- Claims verificables:
  - reported-result: NSD mejoró Avg@8 frente al modelo base en +2.3, +7.5 y +6.0 puntos para Qwen3 de 1.7B, 4B y 8B; los IC95% permanecen positivos.
    - Valor: +2.3/+7.5/+6.0 puntos
    - Baseline: Qwen3 sin entrenamiento adicional
    - Setting: MATH; siete benchmarks matemáticos; dos épocas; modo non-thinking; ocho muestras por problema.
    - Localizador: [§4.1, Table 1](https://arxiv.org/html/2609.11699v1#S4.SS1)
  - reported-result: En Qwen3-4B, NSD produjo 7.5 tokens de reflexión por respuesta frente a 3.6 del baseline, 2.2 con OPSD y 0.8 con Intuitor.
    - Valor: 7.5 frente a 3.6 tokens
    - Baseline: Modelo base y métodos comparadores
    - Setting: AIME 2024, AIME 2025 y HMMT 2025.
    - Localizador: [§4.2, Table 2](https://arxiv.org/html/2609.11699v1#S4.SS2)
- Próxima prueba: Validar en dominios no matemáticos y separar la frecuencia de reflexión de la corrección real mediante jueces y pruebas independientes.

### 05 · Your Retriever Already Knows: Distribution-Shape QPP for RAG Retrieval Sufficiency

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 10 SEP 2026 · arXiv v1
- Área: RAG / ABSTENCIÓN
- Fuente primaria: https://arxiv.org/html/2609.11646v1
- Papel en la síntesis: Predice si el retrieval es suficiente usando la forma de sus scores antes de invocar otro juez LLM.
- Hallazgo observado: Una puerta de 2 ms compite con un juez LLM, pero pierde AUROC fuera de distribución.
- Contribución: Una puerta barata puede ser competitiva dentro de distribución, pero pierde robustez al cambiar de dominio.
- Frontera: Se usa un retriever y un juez local. Falta validación con tráfico real y la variante robusta sacrifica AUROC in-domain.
- Claims verificables:
  - reported-result: GeneralQPP/S1 alcanzó AUROC ponderado 0.856 en ViDoRe frente a 0.835 de Classic Full y 0.649 del juez Qwen3.5; su latencia fue 2.0 ms frente a 6.3 s.
    - Valor: 0.856 AUROC; 2.0 ms/query
    - Baseline: Classic Full y juez local Qwen3.5-35B
    - Setting: 14,514 consultas, ocho dominios ViDoRe, split 80/20 y cinco semillas.
    - Localizador: [§2, Table 3; §4.1, Table 4](https://arxiv.org/html/2609.11646v1#S4.SS1)
  - reported-result: En leave-one-domain-out, S1 cayó de 0.856 a 0.706 AUROC; S1-Lean recuperó hasta 0.719 y superó al baseline clásico en 0.032.
    - Valor: 0.856→0.706; S1-Lean 0.719
    - Baseline: S1 completo y Classic Full en transferencia OOD
    - Setting: ViDoRe LODO; S1-Lean con 13 features.
    - Localizador: [§5, Discussion, OOD Robustness: S1-Lean](https://arxiv.org/html/2609.11646v1#S5)
- Próxima prueba: Probar con tráfico real y calibrar un umbral de abstención por dominio antes de usarlo como gate de producción.

### 06 · JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 9 SEP 2026 · arXiv v1
- Área: AGENTES / MULTIMODAL
- Fuente primaria: https://arxiv.org/html/2609.10451v1
- Papel en la síntesis: Expone el coste de transferir estado y dependencias entre dispositivos en tareas largas.
- Hallazgo observado: La dependencia cross-device reduce TSR a 0–2% en el benchmark.
- Contribución: El rendimiento atómico no predice la coordinación cross-device: las tareas dependientes se acercan a cero.
- Frontera: Sólo modelos open-source y una arquitectura planner–grounder. El benchmark requiere entornos virtualizados específicos.
- Claims verificables:
  - reported-result: En tareas multi-device con dependencias, los seis agentes obtuvieron TSR entre 0% y 2%; el mejor resultado fue 2%.
    - Valor: 0–2% TSR
    - Baseline: Tareas atómicas y cross-platform independientes
    - Setting: 150 tareas: 50 single-platform dependientes, 50 cross-platform independientes y 50 cross-platform dependientes; Android, Windows y Ubuntu.
    - Localizador: [§5, Table 3; §5.2](https://arxiv.org/html/2609.10451v1#S5)
- Próxima prueba: Añadir canarios de transferencia de estado, permisos y recuperación entre dispositivos antes de evaluar la capacidad atómica.

### 07 · ConvMem: Convolutional Memory for Long-Context Reasoning

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 9 SEP 2026 · arXiv v1
- Área: MEMORIA / RAZONAMIENTO
- Fuente primaria: https://arxiv.org/html/2609.10441v1
- Papel en la síntesis: Usa una memoria jerárquica y paralela para agregar contexto largo sin una cadena secuencial completa.
- Hallazgo observado: Mejora el resultado OOD en el protocolo evaluado, pero paga más cómputo total y depende de descomponer bien la consulta.
- Contribución: Mejora el resultado OOD en el protocolo evaluado, pero paga más cómputo total y depende de descomponer bien la consulta.
- Frontera: El conjunto OOD es sintético y contiene un error de etiqueta documentado. La tabla principal no cuantifica de forma completa el coste total ni el error de descomposición.
- Claims verificables:
  - reported-result: ConvMem superó a MemAgent en F1 en las seis longitudes de 28k–896k del benchmark OOD RULER-2WikiMultiHopQA.
    - Valor: 72.30–59.06 frente a 60.92–58.41
    - Baseline: MemAgent entrenado con RL
    - Setting: RULER-HotpotQA como entrenamiento; 2WikiMultiHopQA sintético como OOD; 28k–896k tokens.
    - Localizador: [§3.2, Table 1, filas MemAgent y ConvMem](https://arxiv.org/html/2609.10441v1#S3.SS2)
- Próxima prueba: Medir coste total, errores de descomposición y transferencia a documentos reales antes de preferir memoria paralela.

### 08 · What Should an Agent Forget? Separating What Is Stored from What Is Used

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 9 SEP 2026 · arXiv v1
- Área: MEMORIA / AGENTES
- Fuente primaria: https://arxiv.org/html/2609.10263v1
- Papel en la síntesis: Separa lo que se conserva en el archivo de lo que queda elegible para una respuesta concreta.
- Hallazgo observado: La vista de memoria condicionada por consulta supera las ablaciones y los baselines en 12 combinaciones.
- Contribución: La selección condicionada por consulta puede superar el borrado permanente, pero la evaluación depende en parte de jueces de la misma familia.
- Frontera: Dos benchmarks usan jueces del mismo modelo o familia. Las ablaciones cambian configuraciones completas y no aíslan un único mecanismo.
- Claims verificables:
  - reported-result: RD-Forget obtuvo la mayor exactitud en las 12 combinaciones de cuatro modelos por tres benchmarks.
    - Valor: 12/12 combinaciones; medias 66.59%, 86.71%, 77.13% y 72.83%
    - Baseline: ACE y ReasoningBank
    - Setting: 264 tareas por método: 86 AMB-Text, 78 LME-KU y 100 MAB-FC; cuatro backbones.
    - Localizador: [§4.3, Table 1; §5.1](https://arxiv.org/html/2609.10263v1#S4.SS3)
  - reported-result: Eliminar FORGET o esconder la pregunta al curador produce caídas grandes en los tres benchmarks de Luna.
    - Valor: Full 91.86/93.59/74.00 → sin FORGET 68.60/60.26/51.00
    - Baseline: Configuración matched Full
    - Setting: GPT-5.6-Luna; 264 tareas emparejadas entre configuración completa y ablaciones.
    - Localizador: [§4.4, Table 2](https://arxiv.org/html/2609.10263v1#S4.SS4)
- Próxima prueba: Validar con jueces independientes y con slices que contengan hechos actuales, obsoletos, contradictorios y sensibles.

### 09 · AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 9 SEP 2026 · arXiv v1
- Área: SEGURIDAD / EVALUACIÓN
- Fuente primaria: https://arxiv.org/pdf/2609.09875v1
- Papel en la síntesis: Evalúa planificación, memoria, herramientas, grounding y ataques como una trayectoria completa.
- Hallazgo observado: La traza completa distingue tipos de fallo, pero el ranking queda limitado por juez único y una sola prueba por celda.
- Contribución: La traza completa distingue tipos de fallo, pero el ranking queda limitado por juez único y una sola prueba por celda.
- Frontera: Una prueba por modelo-tarea. El juez fijo también es uno de los modelos evaluados y los pesos del score no están calibrados empíricamente.
- Claims verificables:
  - reported-result: Claude Sonnet 5 obtuvo CTS medio 95.1 y GPT-5 80.6; los otros modelos quedaron entre 57.6 y 22.6.
    - Valor: CTS 95.1 frente a 80.6 y 57.6–22.6
    - Baseline: Comparación entre cinco modelos
    - Setting: 5 modelos × 9 tareas = 45 ejecuciones; seis entornos; 10 métricas agregadas.
    - Localizador: [§VII.A–B, pp.14–15, Table I](https://arxiv.org/pdf/2609.09875v1)
- Próxima prueba: Replicar con múltiples jueces, varias ejecuciones por celda y análisis de sensibilidad de pesos y umbrales.

### 10 · The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 9 SEP 2026 · arXiv v1
- Área: EMPRESA / EVALUACIÓN
- Fuente primaria: https://arxiv.org/html/2609.09853v1
- Papel en la síntesis: Construye un estate empresarial sintético con ground truth exacto para comparar agentes sin datos de clientes.
- Hallazgo observado: El benchmark permite grading determinista, pero la mayoría de las diferencias puntuales del leaderboard no están respaldadas por evidencia suficiente.
- Contribución: El benchmark permite grading determinista, pero la mayoría de las diferencias puntuales del leaderboard no están respaldadas por evidencia suficiente.
- Frontera: Una empresa sintética y 33 formas de pregunta. Los intervalos son amplios y no cubren todas las configuraciones descritas.
- Claims verificables:
  - reported-result: Las exactitudes estimadas abarcaron 42.4%–76.8%, pero sólo 3 de 36 comparaciones por pares aportaron evidencia suficiente para afirmar superioridad.
    - Valor: 42.4–76.8%; 3/36 pares respaldados
    - Baseline: gpt-5.4-mini 42.4% [27.3,58.6]; claude-opus-4.8 76.8% [61.6,90.9]
    - Setting: 9 modelos; 33 preguntas; 3 repeticiones; 891 respuestas; estate sintético con Gong, Salesforce y Zendesk.
    - Localizador: [§6.2, Table 1 y párrafos posteriores; §7](https://arxiv.org/html/2609.09853v1#S6.SS2)
- Próxima prueba: Usar el estate como harness reproducible, pero publicar intervalos, cobertura de pares y answer keys junto al ranking.

### 11 · Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 8 SEP 2026 · arXiv v1
- Área: AGENTES / MEMORIA
- Fuente primaria: https://arxiv.org/html/2609.09153v1
- Papel en la síntesis: Representa procedimientos reutilizables como grafos editables que guían la ejecución y pueden evolucionar.
- Hallazgo observado: La representación procedural gana dentro del protocolo comparado, sin demostrar superioridad universal en arquitecturas heterogéneas.
- Contribución: La representación procedural gana dentro del protocolo comparado, sin demostrar superioridad universal en arquitecturas heterogéneas.
- Frontera: Solver, guidance y refiner comparten LLM y la decodificación es greedy. El paper no presenta una sección explícita de limitaciones.
- Claims verificables:
  - reported-result: Procedural Graph quedó primero o empatado primero en 21/24 combinaciones modelo–benchmark; registró 19 victorias, 2 empates y 3 derrotas frente al mejor baseline, p=4.3×10⁻⁴.
    - Valor: 21/24; 19–2–3; p=4.3×10⁻⁴
    - Baseline: Mejor baseline de cada combinación entre siete métodos
    - Setting: Seis benchmarks × cuatro LLM; mismo solver ReAct; temperatura 0.
    - Localizador: [§5.1, párrafo inicial y Table 1](https://arxiv.org/html/2609.09153v1#S5.SS1)
- Próxima prueba: Separar el efecto del grafo del efecto del mismo LLM, del greedy decoding y del presupuesto de trayectorias.

### 12 · ExecCritic: Learn to Test, Test to Improve for Coding Agents

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 8 SEP 2026 · arXiv v1
- Área: CÓDIGO / VERIFICACIÓN
- Fuente primaria: https://arxiv.org/html/2609.09133v1
- Papel en la síntesis: Separa el rol que genera tests del rol que repara y exige que el feedback sea útil antes de aplicarlo.
- Hallazgo observado: Tener tests no basta: el valor del feedback depende de la calidad del agente que los genera.
- Contribución: Tener tests no basta: el valor del feedback depende de la calidad del agente que los genera.
- Frontera: Se genera un bundle por issue y se reutiliza. En SWE-bench Pro, un único bundle recupera poco margen frente al feedback Oracle.
- Claims verificables:
  - reported-result: Con el agente Qwen de reparación fijo, los tests del Qwen base redujeron la tasa resuelta de 61.2% a 57.3%; los de GPT-5.6-sol la elevaron a 65.3%.
    - Valor: 61.2→57.3%; 65.3% con test cualificado
    - Baseline: Round-0 sin test: 61.2%
    - Setting: SWE-bench Verified; Qwen3.5-35B-A3B como Repair; medias de tres corridas.
    - Localizador: [§5.2.1, Figure 5(b), caption y párrafos de ExecCritic](https://arxiv.org/html/2609.09133v1#S5.SS2)
- Próxima prueba: Introducir un gate de calidad de tests y comparar con tests humanos, tests Oracle y abstención ante tests no fiables.

### 13 · API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 8 SEP 2026 · arXiv v1
- Área: EVALUACIÓN / INTERFAZ
- Fuente primaria: https://arxiv.org/html/2609.08861v1
- Papel en la síntesis: Comprueba si el score de API es un proxy válido del comportamiento de la interfaz conversacional.
- Hallazgo observado: La interfaz real debe evaluarse como parte del sistema desplegado; el checkpoint o prompt no son detalles intercambiables.
- Contribución: La interfaz real debe evaluarse como parte del sistema desplegado; el checkpoint o prompt no son detalles intercambiables.
- Frontera: No se confirma que API e interfaz sirvan siempre el mismo checkpoint. Son benchmarks estandarizados, no conversaciones naturales.
- Claims verificables:
  - reported-result: La exactitud vía API fue 3.4 puntos porcentuales mayor que vía interfaz, con SE=1.11 y p=0.002; los siete sistemas mostraron brecha significativa.
    - Valor: API +3.4 pp; SE 1.11; p=0.002
    - Baseline: La interfaz chatbot de cada sistema
    - Setting: Siete sistemas; nueve benchmarks; cinco corridas por ítem; recolección marzo–mayo de 2026.
    - Localizador: [§3.5; §4.1, Figure 2; §7](https://arxiv.org/html/2609.08861v1#S4.SS1)
- Próxima prueba: Repetir con interfaces de producción, suscripciones y conversaciones naturales antes de trasladar decisiones de procurement desde API.

### 14 · Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 8 SEP 2026 · arXiv v1
- Área: MULTIMODAL / RAG
- Fuente primaria: https://arxiv.org/html/2609.08188v1
- Papel en la síntesis: Alinea el reranking con la utilidad que la evidencia aporta a la respuesta final.
- Hallazgo observado: La relevancia semántica y la utilidad para el generador no son idénticas; la mejora depende de etiquetas y evaluaciones adicionales.
- Contribución: La relevancia semántica y la utilidad para el generador no son idénticas; la mejora depende de etiquetas y evaluaciones adicionales.
- Frontera: La minería requiere respuestas etiquetadas. El re-mining periódico repite el coste de evaluar el VLM.
- Claims verificables:
  - reported-result: Con Qwen3-VL-4B-Instruct, la pérdida contrastiva guiada por el generador alcanzó 96.27±0.03% en VQA-X y 87.00±0.13% en A-OKVQA frente a 94.75% y 85.04% sin entrenamiento.
    - Valor: 96.27/87.00% frente a 94.75/85.04%
    - Baseline: Reranker base sin entrenamiento
    - Setting: Dos épocas; candidate pool top-10; media±desviación estándar de tres semillas.
    - Localizador: [§V-B1, Table III, filas Base y Generator–Contrastive](https://arxiv.org/html/2609.08188v1#S5.SS1)
- Próxima prueba: Medir si la ganancia se conserva sin respuestas etiquetadas frecuentes y frente a retrievers que cambien de dominio.

### 15 · Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks

- Autores: Autores y versión en la fuente primaria
- Fecha y versión: 7 SEP 2026 · arXiv v1
- Área: AGENTES / CONTEXTO
- Fuente primaria: https://arxiv.org/html/2609.09233v1
- Papel en la síntesis: Compara cargar skills en el contexto principal con ejecutar conocimiento reusable en subagentes.
- Hallazgo observado: La ventaja depende de que el paquete procedural tenga contrato de entrada/salida y de que el coste de coordinación compense el ahorro de contexto.
- Contribución: La ventaja depende de que el paquete procedural tenga contrato de entrada/salida y de que el coste de coordinación compense el ahorro de contexto.
- Frontera: Sólo 64/87 tareas admitieron paquetes adecuados. Los subagentes consumen más tokens totales.
- Claims verificables:
  - reported-result: Con skills curadas sin contratos claros, agent-skill igualó o superó a subagents; con skills procedurales y contratos explícitos, subagents superó a agent-skill, especialmente en modelos pequeños.
    - Valor: Ventaja condicional, no regla universal
    - Baseline: Carga de skill en el contexto principal
    - Setting: OpenHands sobre 64 de 87 tareas de SkillsBench; paquetes derivados de trayectorias exitosas.
    - Localizador: [§4, Figure 2 y párrafos Main results; §6](https://arxiv.org/html/2609.09233v1#S4)
- Próxima prueba: Probar contratos explícitos en tareas del propio sistema y medir coste total, latencia, recuperación y pérdida de contexto.

## Conexiones verificadas

- **Physics benchmark audit** — supports → **evidence-before-reasoning**. Eje: Auditar la evidencia antes de comparar. La corrección experta modifica la interpretación de resultados de benchmark; medir primero el instrumento evita razonar sobre errores del grader. Confianza: alta.
- **K-Bench** — extends → **agent-evaluation-as-product**. Eje: Evaluación multicanal. Añade leakage no paramétrico y canales de ejecución a la unidad de evaluación. Confianza: alta.
- **Enterprise Graph RAG** — qualifies → **structured-evidence-joins**. Eje: Estructura y trade-offs. Las uniones estructuradas pueden mejorar la exactitud y empeorar otras dimensiones dentro del mismo experimento. Confianza: alta.
- **Distribution-Shape QPP** — qualifies → **verification-economics**. Eje: Latencia y robustez. La verificación barata no garantiza robustez OOD; el presupuesto debe incluir transferencia de dominio. Confianza: alta.
- **JarvisGUI** — supports → **interface-as-model**. Eje: Superficie de ejecución. La continuidad entre dispositivos condiciona la capacidad efectiva del agente. Confianza: alta.
- **ConvMem** — qualifies → **memory-as-retrieval-policy**. Eje: Memoria y coste. Una política de memoria puede ganar robustez OOD a cambio de más cómputo total. Confianza: alta.
- **RD-Forget** — supports → **memory-as-retrieval-policy**. Eje: Elegibilidad condicionada por consulta. Conservar historia y construir una vista answer-time es distinto de borrar indiscriminadamente. Confianza: alta.
- **AgentAudit** — qualifies → **agent-evaluation-as-product**. Eje: Trazas y juez. La evaluación full-lifecycle aporta cobertura, pero un juez único y single-trial limitan la robustez. Confianza: alta.
- **Era by Eon** — qualifies → **agent-evaluation-as-product**. Eje: Ground truth y cobertura. Un leaderboard con intervalos amplios necesita publicar cobertura de comparación, no sólo el score puntual. Confianza: alta.
- **Procedural Graphs** — supports → **policy-as-interface**. Eje: Procedimiento ejecutable. La estructura procedural funciona como una interfaz operativa dentro del protocolo comparado. Confianza: media.
- **ExecCritic** — qualifies → **runtime-traces-and-assurance**. Eje: Calidad del test. El feedback sólo asegura si el test que lo produce es suficientemente fiable. Confianza: alta.
- **Subagents vs Agent Skills** — qualifies → **small-specialized-agents**. Eje: Contratos de especialización. La especialización no explica sola la ventaja; el contrato procedural y el coste de coordinación son decisivos. Confianza: alta.

## Contradicciones rechazadas

- Enterprise Graph RAG contradice Generator-aligned multimodal RAG: rechazado; migración de código y reranking multimodal usan tareas, mecanismos y métricas distintas.
- ConvMem contradice RD-Forget: rechazado; comparan memoria OOD de contexto largo y elegibilidad answer-time en benchmarks distintos.
- JarvisGUI contradice API vs chatbot: rechazado; TSR cross-device y brecha API–interfaz no son niveles comparables.
- ExecCritic contradice Negative Self-Distillation: rechazado; uno evalúa feedback de tests y el otro modifica entrenamiento matemático.
- AgentAudit contradice Era by Eon: rechazado; juez único y cobertura estadística son limitaciones diferentes y compatibles.
- Physics benchmark audit contradice K-Bench: rechazado; auditoría de benchmark y leakage multicanal son controles complementarios.
- Procedural Graphs contradice Subagents vs Agent Skills: rechazado; ambos muestran efectos procedurales bajo condiciones diferentes.
- QPP contradice generator-aligned multimodal RAG: rechazado; predictor de suficiencia y reranker downstream cumplen funciones distintas.

## Conceptos revisados

- **Evidence before reasoning** (confirm-extension; 3 papers): La evidencia debe auditarse y medirse por suficiencia antes de derivar una comparación o conceder autoridad. Apoyo: Physics benchmark audit, Distribution-Shape QPP y multimodal RAG. Hueco: Falta una métrica común de suficiencia, riesgo y coste.
- **Memory as retrieval policy** (confirm-with-tension; 3 papers): La memoria operativa es una vista condicionada por la consulta, no necesariamente el archivo completo ni un borrado permanente. Apoyo: ConvMem, RD-Forget y K-Bench. Hueco: Faltan jueces independientes y slices de memoria beneficiosa, dañina y neutral.
- **Agent evaluation as product** (confirm-extension; 3 papers): Un benchmark mantenible necesita estate, ground truth, instrumentación, cobertura de pares y atribución del fallo. Apoyo: K-Bench, AgentAudit y Era by Eon. Hueco: Falta un protocolo común de robustez del juez.
- **Runtime traces and assurance** (confirm-extension; 2 papers): La traza y la calidad del feedback importan tanto como el resultado final. Apoyo: AgentAudit y ExecCritic. Hueco: Falta replay multi-juez y una métrica interoperable.
- **Interface as model** (confirm-extension; 2 papers): API, chatbot, dispositivo y continuidad de estado forman parte del sistema evaluado. Apoyo: JarvisGUI y API vs chatbot. Hueco: Falta separar formato, permisos, modelo servido y estado.
- **Policy as interface** (confirm-extension; 2 papers): Los procedimientos y contratos de ejecución determinan qué puede hacer un agente y cómo se valida. Apoyo: Procedural Graphs y K-Bench. Hueco: Falta comprobar delegación dinámica y efectos remotos.
- **Structured evidence joins** (confirm-with-tension; 2 papers): Preservar estructura y procedencia mejora ciertas tareas, pero puede aumentar complejidad o degradar otras dimensiones. Apoyo: Enterprise Graph RAG y Era by Eon. Hueco: El Graph RAG necesita replicación en más repositorios.
- **Small specialized agents** (confirm-extension; 2 papers): La especialización sólo aporta cuando el procedimiento tiene contrato y el coste de coordinación está justificado. Apoyo: ExecCritic y Subagents vs Agent Skills. Hueco: Falta medir el patrón en tareas propias.
- **Verification economics** (candidate; 2 papers): La verificación barata puede fallar OOD; la calidad del verificador debe entrar en el presupuesto. Apoyo: Distribution-Shape QPP y ExecCritic. Hueco: Sólo aparece en este corte; necesita otra semana independiente.
- **Selective recovery** (confirm-extension; 2 papers): La respuesta adecuada a un fallo puede ser abstenerse, cambiar la vista de memoria o recalibrar el gate, no reiniciar todo. Apoyo: QPP y RD-Forget. Hueco: Falta comparar con retry ciego y replay.
- **Downstream-utility-aligned evidence** (candidate; 1 papers): La evidencia puede ordenarse por la utilidad que aporta a la respuesta final, no sólo por similitud semántica. Apoyo: Generator-aligned multimodal RAG. Hueco: Un solo paper; falta comprobar estabilidad sin respuestas etiquetadas frecuentes.
- **Executable procedure substrate** (candidate; 2 papers): El conocimiento reusable gana capacidad cuando se convierte en un procedimiento invocable con contrato y criterio de salida. Apoyo: Procedural Graphs y Subagents vs Agent Skills. Hueco: Falta medir recuperación, coste de coordinación y evolución en tareas propias.
- **Negative behavior distillation** (candidate; 1 papers): Un agente puede aprender a evitar trayectorias defectuosas autogeneradas, pero el efecto aún está acotado al dominio evaluado. Apoyo: Negative Self-Distillation. Hueco: Un solo paper y dominio matemático; falta transferencia y un gate de corrección independiente.

## Siguiente prueba

- **Ratificar el bundle y persistirlo con el mismo runKey.**
- Detalle: Abrir una sesión MCP activa; consultar primero si existe weekly-research:2026-09-07:external-v1; reanudar si existe y, sólo si no existe, crear el run. Entregar al editor el payload íntegro, registrar fallos y repetir replay.
- Métricas: 15 fuentes abiertas, 21 claims, 12 relaciones, 10 extensiones conceptuales y 3 candidatos, IDs, conteos, hashes, abstención, latencia y coste con costStatus=unknown cuando no haya telemetría.
- Regla de parada: No elevar a published/canonical si falta runId, hay duplicados, se pierde un localizador, aparece source-pending como evidencia o se reintroduce TSBench fuera del corte.

## Estado editorial

Edición provisional: 15 fuentes primarias fueron abiertas y 21 claims conservan versión, localizador, baseline, setting y limitación. Las señales scout no se usan como evidencia. La ratificación editorial final quedó en needs-review porque el editor recibió inicialmente un resumen incompleto; además, la corrida MCP no pudo crear un runId por falta de sesión activa de ChatGPT. No se afirma persistencia, replay ni publicación canónica.

## Lo que no se afirma

- No se afirma que el run haya sido persistido, reanudado o reproducido.
- No se afirma que el coste sea cero: si el proveedor no entrega coste, debe quedar como costStatus=unknown.
- No se afirma que los resultados hayan sido replicados independientemente.
- No se afirma que recuperar memoria o evidencia siempre mejore el resultado.