# La evidencia útil no sólo mejora al agente: decide cuándo debe actuar.
> Bundle editorial de Research IA · 17—23 AGO 2026. La página es provisional; la evidencia primaria y sus localizadores están separados de las señales pendientes.

## Navegación y estado

- Página humana: https://luiseduardodemiguel.com/research-ia/weeks/2026-08-17
- Archivo de este corte: https://luiseduardodemiguel.com/research-ia/archive?week=2026-08-17
- Run key: weekly-research:2026-08-17:external-v1
- Prompt version: weekly-research-agents-2026-08-24.1
- Fuentes descubiertas: 12
- Claims seleccionados: 29
- Source-pending usado como evidencia: 0

## Pregunta y tesis

¿Qué cambia cuando un agente debe superar compuertas explícitas de evidencia antes de ejecutar, recordar o publicar una conclusión?

La dirección común no es añadir más razonamiento. Es introducir contratos entre evidencia y acción: leer antes de concluir, validar la interfaz real, conservar trazas y gastar la verificación donde reduce más riesgo.

## Cómo leer el corte

El dossier conecta las fuentes antes de enumerarlas. Cada entrada conserva el papel que juega en la síntesis, un hallazgo observado, su frontera y los claims que se pueden abrir en la fuente primaria.

## Ledger de fuentes

### 01 · SkillEffect: Checked Lowering for Memory-Bounded Agent Tools

- Autores: Yinuo Wang · Yiyu Shi
- Fecha y versión: 17 AGO 2026 · arXiv v1
- Área: RUNTIME / TOOLS
- Fuente primaria: https://arxiv.org/html/2608.17007v1
- Papel en la síntesis: Define el contrato más concreto de la compuerta: una propuesta del modelo no recibe autoridad hasta que un checker reconstruye semántica, límite y postcondición.
- Hallazgo observado: Convierte una instrucción de uso eficiente en una frontera verificable entre propuesta, lowering acotado, ejecución y publicación.
- Contribución: Convierte una instrucción de uso eficiente en una frontera verificable entre propuesta, lowering acotado, ejecución y publicación.
- Frontera: Cubre seis plugins y cinco patrones de ejecución local, determinista y de sólo lectura. Los efectos remotos como pagos o emails necesitan un protocolo de transacción e idempotencia adicional.
- Claims verificables:
  - source-claim: La autoridad sólo se concede cuando hay una única relación aceptada, el límite cabe en el presupuesto y la publicación supera postcondiciones y controles físicos.
    - Valor: Contrato proposal → check → execute
    - Baseline: Ejecución directa o propuesta no verificada
    - Setting: Runtime de herramientas locales con capacidad acotada
    - Localizador: [§2.1, ecuaciones 2–5](https://arxiv.org/html/2608.17007v1#S2.SS1)
  - reported-result: El lowering acotado completó todas las tareas desde un límite de 128 MiB.
    - Valor: 24/24 tareas; AUC 0.950
    - Baseline: Ejecución directa: AUC 0.467; C90=2048 MiB
    - Setting: 24 tareas, seis familias, caps de 64 a 2048 MiB, tres repeticiones
    - Localizador: [§4.2, Figura 2](https://arxiv.org/html/2608.17007v1#S4.SS2)
  - reported-result: El checker aceptó todas las configuraciones legales y rechazó todas las propuestas adversariales evaluadas.
    - Valor: 60/60 aceptadas; 500/500 rechazadas
    - Baseline: Mutaciones de semántica, recursos y bindings
    - Setting: Matriz congelada de cinco relaciones
    - Localizador: [§4.4, Tabla 2](https://arxiv.org/html/2608.17007v1#S4.SS4)
- Próxima prueba: Añadir una API mutable simulada y fallar el worker en prepare/execute/commit; medir duplicados, efectos perdidos, abstenciones y p95 frente a un retry ordinario.

### 02 · The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

- Autores: Bardia Mohammadi · Lars Klein · Aman Chadha · Akhil Arora · Laurent Bindschaedler
- Fecha y versión: 17 AGO 2026 · arXiv v1
- Área: AGENTS / SOFTWARE ENGINEERING
- Fuente primaria: https://arxiv.org/html/2608.16630v1
- Papel en la síntesis: Aporta una explicación causal para la memoria operativa: el agente falla cuando el hecho necesario no está disponible mientras escribe, no simplemente cuando ha leído poco.
- Hallazgo observado: Introduce la idea de coherence debt y muestra que disponibilidad, autoridad y frescura del contexto importan más que el volumen bruto de lectura.
- Contribución: Introduce la idea de coherence debt y muestra que disponibilidad, autoridad y frescura del contexto importan más que el volumen bruto de lectura.
- Frontera: La mayoría de workloads son migraciones sintéticas y el estado interno del agente sólo se observa mediante proxies. El contraste no separa por completo autoridad, modalidad y orden de lectura.
- Claims verificables:
  - reported-result: Sin workspace ni conocimiento previo específico, ninguna prueba resolvió la migración; al suministrar reglas y fuente, casi todas alcanzaron al menos 9 de 12 requisitos.
    - Valor: 0/154 frente a 299/300 pruebas
    - Baseline: Novel closed-book
    - Setting: Migraciones de API con disponibilidad de hechos como variable
    - Localizador: [§4.1, Tabla 2](https://arxiv.org/html/2608.16630v1#S4.SS1)
  - reported-result: Retirar hechos elimina exactamente el trabajo que esos hechos sostenían.
    - Valor: 32, 24, 16, 8, 0 tests al retirar 0, 2, 4, 6, 8 hechos
    - Baseline: 32/32 con todos los hechos
    - Setting: Fault injection con archivo eliminado o stub de igual longitud
    - Localizador: [§4.3, tabla de facts withheld](https://arxiv.org/html/2608.16630v1#S4.SS3)
  - reported-result: Ante un estándar escrito obsoleto y código funcional, los agentes siguieron el estándar y tomaron peores decisiones que sin estándar.
    - Valor: 39/39 conflictos siguieron el documento
    - Baseline: Sin estándar: 33% de decisiones en la forma mejor
    - Setting: Conflictos entre convención escrita y código
    - Localizador: [§4.8–4.9, tabla de standard conflict](https://arxiv.org/html/2608.16630v1#S4.SS8)
- Próxima prueba: Prerregistrar tareas no migratorias y aleatorizar el mismo hecho como ausente, temprano, reciente o refrescado; comparar retrieval léxico, imports y grafo de dependencias.

### 03 · A Policy Algebra for Trust-Preserving Agentic AI Execution

- Autores: Bhaskar Tripathi · Anurag Kumar · Ramendra Kumar · Bhavesh Gadhe
- Fecha y versión: 17 AGO 2026 · arXiv v1
- Área: GOVERNANCE / SECURITY
- Fuente primaria: https://arxiv.org/abs/2608.16402v1
- Papel en la síntesis: Extiende la compuerta de evidencia a identidad, permisos, presupuesto, memoria, aprobación y auditoría: la capacidad fiable es una propiedad de la trayectoria.
- Hallazgo observado: Formaliza cómo componer restricciones sin convertir el éxito de una tarea en prueba suficiente de fiabilidad.
- Contribución: Formaliza cómo componer restricciones sin convertir el éxito de una tarea en prueba suficiente de fiabilidad.
- Frontera: Los teoremas dependen de que políticas, contexto y metadatos estén correctamente representados. El workload es finito y quedan abiertas delegación dinámica, perfiles incomparables y efectos remotos.
- Claims verificables:
  - source-claim: La composición produce el estado menos restrictivo que satisface simultáneamente las políticas gobernantes.
    - Valor: Composición por joins, intersecciones, narrowing y acumulación de evidencia
    - Baseline: RBAC y allowlists independientes
    - Setting: Perfil, herramientas, memoria, presupuesto, artefactos, aprobación y evidencia
    - Localizador: [§5, Teoremas 1–2, ecuación 10, p.13](https://arxiv.org/pdf/2608.16402v1)
  - reported-result: El runtime intervino en más eventos inseguros que el comparador.
    - Valor: 94.8% frente a 67.1%
    - Baseline: RBAC + allowlist
    - Setting: 612 trazas, 1.936 eventos, cinco familias de workload
    - Localizador: [§11, Tablas 9–10 y Figura 6, pp.34–35](https://arxiv.org/pdf/2608.16402v1)
  - reported-result: El enforcement aumentó auditabilidad, pero con más latencia y menor finalización.
    - Valor: Audit 71.9→98.6%; completion 90.7→86.9%; mediana 38→71 ms
    - Baseline: RBAC + allowlist
    - Setting: Mismo workload de evaluación
    - Localizador: [§11, Tabla 10, pp.35–37](https://arxiv.org/pdf/2608.16402v1)
- Próxima prueba: Inyectar errores de scopes y criticidad durante árboles multiagente de profundidad 1–5; bloquear ante cualquier ampliación silenciosa de herramientas, memoria, presupuesto o aprobación.

### 04 · D²ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

- Autores: Xule Liu · Yijun Liu · Chao Li · Shao Kun
- Fecha y versión: 19 AGO 2026 · arXiv v2
- Área: MEMORY / DIAGNOSIS
- Fuente primaria: https://arxiv.org/html/2608.17756v2
- Papel en la síntesis: Muestra que la memoria debe conservar no sólo contenido, sino trazas suficientes para explicar y recuperar una ejecución.
- Hallazgo observado: Desplaza la evaluación desde una métrica final hacia gates, slices protegidos y localización de causas.
- Contribución: Desplaza la evaluación desde una métrica final hacia gates, slices protegidos y localización de causas.
- Frontera: La auditoría de causas usa 60 casos y modelos concretos. Las ablaciones no se replican todavía en todos los benchmarks.
- Claims verificables:
  - reported-result: Mantener recuperación de memoria de sesión mejoró LongMemEval.
    - Valor: +3.67 puntos porcentuales; 90.94% frente a 87.27%
    - Baseline: No Session
    - Setting: LongMemEval, n=500, comparación pareada
    - Localizador: [§4.2, Tabla 3, fila LME / No Session](https://arxiv.org/html/2608.17756v2#S4.SS2)
  - reported-result: Las trazas enriquecidas localizaron causas de fallo con mayor concordancia que answer+score aislados.
    - Valor: Cohen κ .571 frente a .258
    - Baseline: Resultado y score únicamente
    - Setting: Paquete de auditoría de 60 casos
    - Localizador: [§4.3, Tabla 2](https://arxiv.org/html/2608.17756v2#S4.SS3)
- Próxima prueba: Introducir un fallo tras persistir un checkpoint y comprobar con el mismo runKey que la decisión, los hashes y los conteos se conservan sin duplicados.

### 05 · Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch

- Autores: Jialong Li · Jialing Zhu
- Fecha y versión: 18 AGO 2026 · arXiv v1
- Área: SECURITY / EVOLUTION
- Fuente primaria: https://arxiv.org/html/2608.17684v1
- Papel en la síntesis: Aporta el contraejemplo operativo: un agente puede parecer seguro o inútil porque el artefacto que aprendió no coincide con la interfaz que realmente ejecuta.
- Hallazgo observado: Obliga a separar utilidad, deriva de seguridad, cambios no autorizados y compatibilidad artefacto–ejecutor.
- Contribución: Obliga a separar utilidad, deriva de seguridad, cambios no autorizados y compatibilidad artefacto–ejecutor.
- Frontera: Un único ejecutor y un entorno bancario simulado. Una única evolución offline y sin atribución causal aislada por representación.
- Claims verificables:
  - reported-result: SkillOpt aumentó utilidad, pero también exposición a ataques y cambios financieros no autorizados.
    - Valor: Utilidad +9.6 pp; exposición +12.3 pp; estado no autorizado +10.2 pp
    - Baseline: Utility .741; exposure .820; unauthorized state .583
    - Setting: AgentDojo Banking corregido; benign n=135, ataques n=405
    - Localizador: [§4, Tabla 3; §4.4, Tabla 6](https://arxiv.org/html/2608.17684v1#S4)
  - reported-result: Una incompatibilidad de formato hizo que acciones textuales no produjeran ninguna llamada real.
    - Valor: 380/540 rollouts; 70.4%
    - Baseline: Ejecutor que requería function calling nativo
    - Setting: AWM-LiteralPort con bloques <action> textuales
    - Localizador: [§4.5, párrafos iniciales](https://arxiv.org/html/2608.17684v1#S4.SS5)
- Próxima prueba: Ejecutar canarios de interfaz sobre cada artefacto congelado con el ejecutor original y el de despliegue; bloquear si una acción declarada no produce la llamada equivalente.

### 06 · Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

- Autores: Sher Badshah · Ali Emami · Hassan Sajjad
- Fecha y versión: 18 AGO 2026 · arXiv v1
- Área: EVIDENCE / ABSTENTION
- Fuente primaria: https://arxiv.org/html/2608.17994v1
- Papel en la síntesis: Da una salida explícita a la incertidumbre: juzgar, recuperar y abstenerse son estados distintos, no etapas que siempre terminan en aceptación.
- Hallazgo observado: Ofrece un patrón para medir cobertura y riesgo cuando la recuperación puede resolver o empeorar la incertidumbre.
- Contribución: Ofrece un patrón para medir cobertura y riesgo cuando la recuperación puede resolver o empeorar la incertidumbre.
- Frontera: La garantía depende de exchangeability y del snapshot usado para calibrar. Cambiar tarea, modelo o calidad de recuperación exige recalibración.
- Claims verificables:
  - reported-result: La recuperación calibrada elevó la cobertura sin superar el límite de riesgo configurado.
    - Valor: 82% de instancias aceptadas frente a 7%
    - Baseline: Mode 1 Only
    - Setting: NQ-Open; α=.20; top-k=3; 100 particiones calibración-test
    - Localizador: [§5.4, Tabla 2](https://arxiv.org/html/2608.17994v1#S5.SS4)
  - reported-result: Recuperar aumentó la incertidumbre en una fracción material de los casos y debe poder acabar en abstención.
    - Valor: 14.3%–29.1% según benchmark
    - Baseline: Entropía antes de recuperar
    - Setting: TriviaQA, NQ-Open, PopQA y HotpotQA
    - Localizador: [Apéndice E.1, Tabla 14](https://arxiv.org/html/2608.17994v1#Apx.E.SS1)
- Próxima prueba: Evaluar un conjunto congelado con fuentes ausentes, contradictorias, irrelevantes y controles respondibles; medir FDR, cobertura, abstención correcta y precisión de citas.

### 07 · MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

- Autores: Mengru Wang · Haozhe Luo · Zhenqian Xu · Zhixiang Cui · Haoming Xu · Qu Yang · Jizhan Fang · Junfeng Fang · Ningyu Zhang
- Fecha y versión: 20 AGO 2026 · arXiv v1
- Área: MEMORY / EVALUATION
- Fuente primaria: https://arxiv.org/html/2608.20202v1
- Papel en la síntesis: Limita la tesis fácil de que la memoria siempre ayuda: una memoria relevante puede fijar un razonamiento o distorsionar una creencia.
- Hallazgo observado: Introduce slices de trampas cognitivas y obliga a comparar memoria contra no-memory antes de promover una política de recuperación.
- Contribución: Introduce slices de trampas cognitivas y obliga a comparar memoria contra no-memory antes de promover una política de recuperación.
- Frontera: Las trampas son diseñadas y no se mide su prevalencia natural. La evaluación cubre dos familias de modelos y depende en parte de jueces LLM.
- Claims verificables:
  - reported-result: La mejor estrategia de memoria quedó por debajo de no usar memoria en ambos modelos.
    - Valor: Gemini −13.99 pp; Qwen −15.36 pp
    - Baseline: No memory: 85.16% y 81.83%
    - Setting: Cuatro escenarios de reasoning fixation y belief distortion
    - Localizador: [§3.2, Tabla 1](https://arxiv.org/html/2608.20202v1#S3.SS2)
  - reported-result: Introducir sólo el 25% del historial trap-inducing provocó la mayor caída, y ampliarlo empeoró más el resultado.
    - Valor: 92.29% sin memoria → 36.03% con 25% → 31.05% con 100%
    - Baseline: No memory
    - Setting: Ablación de longitud sobre Task Boundary
    - Localizador: [§3.4, Tabla 4](https://arxiv.org/html/2608.20202v1#S3.SS4)
  - source-claim: La memoria no debe promoverse por mejorar sólo el slice con trampas: debe conservar controles sin trampa y comparación contra no-memory.
    - Valor: Regla editorial derivada del protocolo
    - Baseline: Promoción por score agregado
    - Setting: Slices beneficioso, dañino y neutral
    - Localizador: [§3.2, Tabla 1 y discusión](https://arxiv.org/html/2608.20202v1#S3.SS2)
- Próxima prueba: Aplicar retrieve → challenge-memory → use/ignore sobre ejemplos trap, trap-free y LongMemEval; no promover si mejora un slice y pierde frente a no-memory en otro protegido.

### 08 · MUSE: An Interactive Meta-Agent for Understanding and Steering LLM-powered Data Science Systems

- Autores: Wei-Hao Chen · Weixi Tong · Yuan Tian · Chenglong Wang · Tianyi Zhang
- Fecha y versión: 17 AGO 2026 · arXiv v1
- Área: INTERFACE / RECOVERY
- Fuente primaria: https://arxiv.org/html/2608.16181v1
- Papel en la síntesis: Trata la interfaz de observabilidad como parte del sistema: una traza jerárquica puede convertirse en advertencia, diagnóstico y reparación situada.
- Hallazgo observado: Conecta la forma de presentar eventos con la capacidad humana de recuperar una trayectoria.
- Contribución: Conecta la forma de presentar eventos con la capacidad humana de recuperar una trayectoria.
- Frontera: Estudio pequeño: 15 participantes y seis tareas controladas. La ventaja frente a DiLLS no fue estadísticamente significativa y la muestra no representa a operadores expertos.
- Claims verificables:
  - reported-result: MUSE redujo el tiempo medio de finalización frente a logs crudos.
    - Valor: 17 frente a 25 minutos; −35%
    - Baseline: Raw Logs
    - Setting: Between-subjects, n=15, seis tareas de data science
    - Localizador: [§7.1.1, Tabla 4](https://arxiv.org/html/2608.16181v1#S7.SS1)
  - reported-result: La reparación contextualizada resolvió más advertencias que la misma detección sin reparación in situ.
    - Valor: 2.8 frente a 0.8 advertencias por participante
    - Baseline: DiLLS sin repair contextual
    - Setting: Condiciones B y C con detección comparable
    - Localizador: [§7.1.4; mecanismo en §4.4.1](https://arxiv.org/html/2608.16181v1#S7.SS1.SSS4)
- Próxima prueba: Comparar logs crudos, resumen jerárquico y dossier accionable sobre fallos idénticos; medir tiempo a diagnóstico, repairs verificadas, reinicios y falsos repairs.

### 09 · DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

- Autores: Zijie Meng · Xiwei Dai · Yixuan Tang · Jin Hao · Yang Feng · Fudong Zhu · Xiaoqiang Liu · Shaosheng Cao · Zuozhu Liu
- Fecha y versión: 19 AGO 2026 · arXiv v1
- Área: MULTIMODAL / EVIDENCE
- Fuente primaria: https://arxiv.org/html/2608.18878v1
- Papel en la síntesis: Aporta un blackboard de evidencia que conserva cobertura, huecos y conflictos antes de generar la respuesta.
- Hallazgo observado: Muestra en un dominio multimodal que Identify–Delegate–Observe–Verify es más informativo que una primera pasada sin comprobación.
- Contribución: Muestra en un dominio multimodal que Identify–Delegate–Observe–Verify es más informativo que una primera pasada sin comprobación.
- Frontera: Evaluación retrospectiva en cuatro benchmarks, sin validación clínica prospectiva. Parte de la evaluación usa un juez GPT-5-mini y no especialistas ciegos.
- Claims verificables:
  - reported-result: La ejecución agéntica de una pasada mejora frente a inferencia directa.
    - Valor: +17.48 puntos de model-judge score
    - Baseline: Inferencia directa
    - Setting: MMOralBench; Qwen3.5-9B y herramientas constantes
    - Localizador: [§IV-D, Figura 2](https://arxiv.org/html/2608.18878v1#S4.SS4)
  - reported-result: Restaurar el ciclo iterativo Identify–Delegate–Observe–Verify mejora sobre single-pass.
    - Valor: 48.40 → 52.83; +4.43 puntos
    - Baseline: Single-pass agentic execution
    - Setting: MMOralBench; mismo backbone y toolset
    - Localizador: [§IV-D, Figura 2, Iterative Verification](https://arxiv.org/html/2608.18878v1#S4.SS4)
- Próxima prueba: Comparar inferencia directa, single-pass y ciclo completo en un estudio prospectivo ciego; medir sensibilidad, especificidad, calibración, conflictos, coste y tiempo.

### 10 · SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

- Autores: Yanlun Tu · Huacan Wang · Ziyue Zhou · Jie Zhou · Ningyan Zhu · Ge Chen · Wangyi Chen · Tengfei Zhou · Yifan Zhou · Dasheng Yang · Xiaofeng Mou · Hui Zhang · Yi Xu
- Fecha y versión: 19 AGO 2026 · arXiv v1
- Área: AGENTS / VERIFICATION
- Fuente primaria: https://arxiv.org/html/2608.18565v1
- Papel en la síntesis: Traslada la compuerta de evidencia al código industrial: una tarea sólo termina cuando pasan especificación, compilación y comportamiento runtime.
- Hallazgo observado: Aporta una referencia clara para medir la mejora de un harness y su coste de interacción.
- Contribución: Aporta una referencia clara para medir la mejora de un harness y su coste de interacción.
- Frontera: Los escenarios dinámicos son acotados y la ventaja se reduce con el modelo más fuerte. La verificación formal queda inconclusa en 174 propiedades de 32 programas con temporizadores TON.
- Claims verificables:
  - reported-result: El harness completo mejora la tasa media de aprobación estrictamente verificada.
    - Valor: 72.6% frente a 55.3%; +17.3 pp
    - Baseline: Configuración bare
    - Setting: 117 tareas function-track; siete modelos de cinco proveedores
    - Localizador: [§5.4, tabla function-track, fila Mean](https://arxiv.org/html/2608.18565v1#S5.SS4)
  - reported-result: El comportamiento dinámico medio supera a los baselines.
    - Valor: 52.2 frente a 31.4; +20.8 pp
    - Baseline: AutoPLC, mejor baseline medio
    - Setting: 65 tareas project-track; fallos de compilación, despliegue o trazas puntúan cero
    - Localizador: [§5.4, Tabla 2, Dynamic behavior](https://arxiv.org/html/2608.18565v1#S5.SS4)
  - reported-result: Añadir gates mejora el score dinámico, pero incrementa tokens y solicitudes.
    - Valor: 23.1 → 54.1; 34k → 129k tokens; 8.9 → 47.8 requests
    - Baseline: Sin capas de verificación
    - Setting: Ablation project-track; 65 tareas
    - Localizador: [§6.3, Tablas 3–4](https://arxiv.org/html/2608.18565v1#S6.SS3)
- Próxima prueba: Generar escenarios ocultos con timers y transiciones entre scans; aceptar sólo si la ventaja dinámica supera 5 puntos sin fallos peligrosos no detectados.

### 11 · Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

- Autores: Atsuyuki Miyai · Kiyoharu Aizawa · Toshihiko Yamasaki
- Fecha y versión: 20 AGO 2026 · arXiv v1
- Área: EVALUATION / COSTE
- Fuente primaria: https://arxiv.org/html/2608.20169v1
- Papel en la síntesis: Aporta la dimensión económica que falta en un gate: la selección adaptativa puede reservar evidencia para las tareas que realmente discriminan entre harnesses.
- Hallazgo observado: Conecta rigor y presupuesto sin asumir que evaluar todo en cada iteración sea la opción más fiable.
- Contribución: Conecta rigor y presupuesto sin asumir que evaluar todo en cada iteración sea la opción más fiable.
- Frontera: La asignación es fija antes de observar resultados y no detiene temprano candidatos claramente inferiores. Con presupuestos muy pequeños pierde capacidad de ranking.
- Claims verificables:
  - reported-result: Con el 20% del pool por iteración casi iguala la búsqueda completa.
    - Valor: 51.7% frente a 52.8%; −1.1 pp
    - Baseline: Meta-Harness Full Search al 100%
    - Setting: Terminal-Bench 2.1; 89 tareas
    - Localizador: [§4.4, Tabla 2](https://arxiv.org/html/2608.20169v1#S4.SS4)
  - reported-result: Reduce el coste de búsqueda declarado con GPT-5.6-Luna.
    - Valor: 2.888M → 579M tokens; $117 → $30; 22.2 → 11.5 h
    - Baseline: Full Search, 890 trials
    - Setting: Terminal-Bench 2.1; Task-CoEvolve 180 trials
    - Localizador: [§4.5, Tabla 3](https://arxiv.org/html/2608.20169v1#S4.SS5)
- Próxima prueba: Comparar presupuesto fijo contra asignación secuencial con intervalos de confianza y conjunto final sellado; exigir regret ≤1.5 puntos y al menos 25% menos coste.

### 12 · Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

- Autores: Cheng Yu · Nikhil Mathew · Zhengjie Wang
- Fecha y versión: 21 AGO 2026 · arXiv v1
- Área: INTERFACE / CONTEXT
- Fuente primaria: https://arxiv.org/html/2608.20786v1
- Papel en la síntesis: Califica la idea de que más estructura siempre ayuda: el markup mejora lectura, pero puede perjudicar el material que condiciona la escritura.
- Hallazgo observado: Sugiere separar la interfaz de recuperación de la interfaz de generación, en vez de usar un único formato para todo el ciclo.
- Contribución: Sugiere separar la interfaz de recuperación de la interfaz de generación, en vez de usar un único formato para todo el ciclo.
- Frontera: La comparación principal usa una sola licitación y un juez LLM de la misma familia del generador. La generalización a modelos frontier y evaluación humana ciega queda sin probar.
- Claims verificables:
  - reported-result: El markup estructurado mejora cobertura y reproducibilidad en tareas de lectura.
    - Valor: Annotation routing 61% → 97.8%
    - Baseline: Texto plano
    - Setting: Tres tareas instrumentadas de lectura
    - Localizador: [§3.4, Figura 3 y Tabla 3](https://arxiv.org/html/2608.20786v1#S3.SS4)
  - reported-result: Aplicar XML anidado al material usado para escribir empeora la respuesta respecto a prosa.
    - Valor: 23/31 veredictos favorables en prosa frente a 15/31 en XML
    - Baseline: Mismas instrucciones en prosa
    - Setting: 31 respuestas por brazo; contenido y tamaño constantes
    - Localizador: [§3.5, Tabla 4](https://arxiv.org/html/2608.20786v1#S3.SS5)
- Próxima prueba: Repetir el factorial prosa/markup en varios dominios, modelos y jueces independientes; medir cobertura, calidad, claims no soportados, restatement y acuerdo.

## Conexiones verificadas

- **MemTrapBench** — qualifies → **D²ACCI**. Eje: Efecto de recuperar memoria sobre la respuesta. La memoria puede mejorar cuando conserva hechos necesarios y perjudicar cuando introduce fijación o autoridad obsoleta; no es una contradicción directa porque cambian benchmark y contenido. Confianza: 0.99.
- **DentAgent** — supports → **SemaPLC**. Eje: Verificación iterativa frente a primera pasada. Dos dominios muestran en la misma dirección que integrar Identify–Delegate–Observe–Verify o gates de runtime mejora el resultado. Confianza: 0.97.
- **Policy Algebra** — qualifies → **SkillEffect**. Eje: Enforcement previo a conceder autoridad. El enforcement puede elevar seguridad, pero también introducir latencia, falsas intervenciones y menor finalización. Confianza: 0.98.
- **Self-Evolution Audit** — supports → **SkillEffect**. Eje: Validación de interfaz antes de ejecutar. El mismatch artefacto–ejecutor justifica un gate que compruebe la relación real entre propuesta, ejecutor y postcondición. Confianza: 0.98.
- **Structure for Reading** — qualifies → **Working Set**. Eje: Disponibilidad y representación del contexto. Tener el hecho disponible no basta: la representación debe adaptarse a si el agente está leyendo o escribiendo. Confianza: 0.98.
- **MUSE** — supports → **D²ACCI**. Eje: Trazas para diagnóstico y recovery. La observabilidad estructurada convierte logs en diagnósticos reparables y mejora la localización de causas. Confianza: 0.97.
- **Judge / Retrieve / Abstain** — qualifies → **SemaPLC**. Eje: Gates y decisión posterior a la evidencia. Verificar más puede mejorar la calidad, pero no justifica aceptar automáticamente: debe existir una salida explícita de abstención. Confianza: 0.96.
- **Task-CoEvolve** — extends → **SemaPLC**. Eje: Coste de validación en harnesses. La selección adaptativa conserva señal de validación reduciendo parte del coste que introducen gates intensivos. Confianza: 0.94.

## Contradicciones rechazadas

- MemTrapBench contradicts D²ACCI: rechazado; comparan memoria trap-inducing con memoria de sesión útil.
- Judge/Retrieve/Abstain contradicts SemaPLC: rechazado; mecanismos y tareas no comparten eje experimental.
- Policy Algebra contradicts SkillEffect: rechazado; dominios, runtimes y presupuestos distintos.
- Working Set contradicts Structure for Reading: rechazado; disponibilidad causal y formato no son proposiciones incompatibles.
- Self-Evolution Audit contradicts Policy Algebra: rechazado; deriva de seguridad y enforcement responden a preguntas diferentes.

## Conceptos revisados

- **Evidence gates antes del reasoning** (confirm-extension; 6 papers): La evidencia deja de ser contexto pasivo y decide si ejecutar, recuperar, verificar, abstenerse o aceptar. Apoyo: Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect. Hueco: Falta una métrica común que combine riesgo, cobertura, coste y latencia.
- **La política como interfaz de ejecución** (confirm-extension; 3 papers): Autoridad, presupuesto, evidencia y postcondiciones forman parte del contrato que interpreta y valida el agente. Apoyo: Policy Algebra, SkillEffect y Self-Evolution Audit. Hueco: Falta demostrar no escalada bajo delegación dinámica y efectos remotos.
- **La memoria como política de recuperación** (confirm-with-tension; 5 papers): La memoria ayuda cuando conserva hechos necesarios y actuales, pero perjudica si introduce fijación, obsolescencia o autoridad indebida. Apoyo: D²ACCI, Working Set, MemTrapBench y Judge/Retrieve/Abstain. Hueco: Falta una evaluación conjunta con slices beneficiosos, dañinos y neutrales.
- **Recovery selectivo** (confirm-extension; 4 papers): La recuperación útil localiza un fallo concreto y aplica una intervención limitada en vez de reiniciar todo el sistema. Apoyo: D²ACCI, MUSE, Judge/Retrieve/Abstain y DentAgent. Hueco: Faltan comparaciones con retry ciego y garantías comunes de idempotencia.
- **Trazas de runtime y assurance** (confirm-extension; 5 papers): El resultado final no basta: llamadas reales, eventos, gates y cambios de estado explican y aseguran la ejecución. Apoyo: D²ACCI, Self-Evolution Audit, Policy Algebra, MUSE y SemaPLC. Hueco: Falta un esquema interoperable de eventos y replay determinista.
- **La interfaz como parte del modelo** (confirm-extension; 5 papers): Cambiar la interfaz de información, representación o ejecución puede cambiar la capacidad sin cambiar el modelo base. Apoyo: Self-Evolution Audit, Structure for Reading, MUSE, Working Set y SkillEffect. Hueco: Hay que separar efectos de formato, orden y autoridad.
- **Economía de la verificación** (candidate; 3 papers): La verificación debe asignarse como un presupuesto: más gates consumen tokens, dinero y latencia. Apoyo: SemaPLC, Task-CoEvolve y Policy Algebra. Hueco: Sólo aparece en este corte; necesita soporte independiente en otra semana.

## Siguiente prueba

- **Persistir y reproducir la corrida sin fingir que el dossier ya es canónico.**
- Detalle: Crear el run con el mismo runKey, guardar fuentes, claims, relaciones y revisiones; registrar el fallo de autenticación; reanudar después de un checkpoint y repetir el replay.
- Métricas: IDs, conteos, hashes, precisión de citas, abstención correcta, duración por etapa y coste con costStatus=unknown si el proveedor no lo entrega.
- Regla de parada: No promover a published si hay pérdida de estado, duplicados, locator roto, source-pending usado como evidencia o ampliación silenciosa de permisos.

## Estado editorial

Dossier editorial provisional. Las fuentes primarias, versiones y localizadores fueron comprobados por lectores externos; el paquete todavía no es una corrida canónica persistida porque la sesión autenticada necesaria para escribir en MCP no estuvo disponible.

## Lo que no se afirma

- No se afirma que el run haya sido persistido, reanudado o reproducido.
- No se afirma que el coste sea cero: si el proveedor no entrega coste, debe quedar como costStatus=unknown.
- No se afirma que los resultados hayan sido replicados independientemente.
- No se afirma que recuperar memoria o evidencia siempre mejore el resultado.