NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 34 · AGO 2026
17—23 AGO 202612 LECTURAS PRIMARIAS0 EN COLA29 CLAIMS

La evidencia útil no sólo mejora al agente: decide cuándo debe actuar.

Doce fuentes primarias convergen en una arquitectura más exigente: memoria, recuperación, interfaces y verificación sólo aportan valor cuando el sistema puede demostrar qué leyó, qué comprobó, qué coste asumió y cuándo debe abstenerse.

ESTADO EDITORIAL12 fuentes primarias abiertas · 0 señales scout sin claims
EN UNA FRASE

La dirección común no es añadir más razonamiento. Es introducir contratos entre evidencia y acción: leer antes de concluir, validar la interfaz real, conservar trazas y gastar la verificación donde reduce más riesgo.

PREGUNTA QUE GUÍA EL CORTE

¿Qué cambia cuando un agente debe superar compuertas explícitas de evidencia antes de ejecutar, recordar o publicar una conclusión?

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / COMPUERTAS DE EVIDENCIA

Leer, comprobar, abstenerse.

Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.

02 / POLÍTICA DE MEMORIA

Más memoria no es mejor memoria.

D²ACCI y Working Set muestran cuándo conservar hechos ayuda; MemTrapBench muestra cuándo una memoria aparentemente relevante fija errores o autoridad caducada.

03 / RECOVERY TRAZABLE

El resultado final no explica el fallo.

MUSE, D²ACCI y Self-Evolution Audit hacen visible la distancia entre lo que el agente dijo, lo que el runtime ejecutó y lo que otro agente puede recuperar.

04 / ECONOMÍA DE LA VERIFICACIÓN

Rigor con presupuesto.

Policy Algebra y SemaPLC muestran el coste de verificar; Task-CoEvolve propone asignar más evaluación donde todavía discrimina entre harnesses.

02LEDGER DE FUENTES / QUÉ SOSTIENE LA TESIS

Cada paper aparece una vez: papel, hallazgo y frontera.

La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.

  1. 01 / RUNTIME / TOOLS17 AGO 2026 · arXiv v1

    SkillEffect

    Define el contrato más concreto de la compuerta: una propuesta del modelo no recibe autoridad hasta que un checker reconstruye semántica, límite y postcondición.

    HALLAZGO OBSERVADO

    Convierte una instrucción de uso eficiente en una frontera verificable entre propuesta, lowering acotado, ejecución y publicación.

    FRONTERA

    Cubre seis plugins y cinco patrones de ejecución local, determinista y de sólo lectura. Los efectos remotos como pagos o emails necesitan un protocolo de transacción e idempotencia adicional.

    ABRIR EVIDENCIA LOCALIZABLE3 claims +
    1. La autoridad sólo se concede cuando hay una única relación aceptada, el límite cabe en el presupuesto y la publicación supera postcondiciones y controles físicos.

      Contrato proposal → check → execute · baseline: Ejecución directa o propuesta no verificada · Runtime de herramientas locales con capacidad acotada
    2. reported-result§4.2, Figura 2

      El lowering acotado completó todas las tareas desde un límite de 128 MiB.

      24/24 tareas; AUC 0.950 · baseline: Ejecución directa: AUC 0.467; C90=2048 MiB · 24 tareas, seis familias, caps de 64 a 2048 MiB, tres repeticiones
    3. reported-result§4.4, Tabla 2

      El checker aceptó todas las configuraciones legales y rechazó todas las propuestas adversariales evaluadas.

      60/60 aceptadas; 500/500 rechazadas · baseline: Mutaciones de semántica, recursos y bindings · Matriz congelada de cinco relaciones
    Fuente primaria ↗Próxima prueba: Añadir una API mutable simulada y fallar el worker en prepare/execute/commit; medir duplicados, efectos perdidos, abstenciones y p95 frente a un retry ordinario.
  2. 02 / AGENTS / SOFTWARE ENGINEERING17 AGO 2026 · arXiv v1

    Working Set

    Aporta una explicación causal para la memoria operativa: el agente falla cuando el hecho necesario no está disponible mientras escribe, no simplemente cuando ha leído poco.

    HALLAZGO OBSERVADO

    Introduce la idea de coherence debt y muestra que disponibilidad, autoridad y frescura del contexto importan más que el volumen bruto de lectura.

    FRONTERA

    La mayoría de workloads son migraciones sintéticas y el estado interno del agente sólo se observa mediante proxies. El contraste no separa por completo autoridad, modalidad y orden de lectura.

    ABRIR EVIDENCIA LOCALIZABLE3 claims +
    1. reported-result§4.1, Tabla 2

      Sin workspace ni conocimiento previo específico, ninguna prueba resolvió la migración; al suministrar reglas y fuente, casi todas alcanzaron al menos 9 de 12 requisitos.

      0/154 frente a 299/300 pruebas · baseline: Novel closed-book · Migraciones de API con disponibilidad de hechos como variable
    2. Retirar hechos elimina exactamente el trabajo que esos hechos sostenían.

      32, 24, 16, 8, 0 tests al retirar 0, 2, 4, 6, 8 hechos · baseline: 32/32 con todos los hechos · Fault injection con archivo eliminado o stub de igual longitud
    3. Ante un estándar escrito obsoleto y código funcional, los agentes siguieron el estándar y tomaron peores decisiones que sin estándar.

      39/39 conflictos siguieron el documento · baseline: Sin estándar: 33% de decisiones en la forma mejor · Conflictos entre convención escrita y código
    Fuente primaria ↗Próxima prueba: Prerregistrar tareas no migratorias y aleatorizar el mismo hecho como ausente, temprano, reciente o refrescado; comparar retrieval léxico, imports y grafo de dependencias.
  3. 03 / GOVERNANCE / SECURITY17 AGO 2026 · arXiv v1

    Policy Algebra

    Extiende la compuerta de evidencia a identidad, permisos, presupuesto, memoria, aprobación y auditoría: la capacidad fiable es una propiedad de la trayectoria.

    HALLAZGO OBSERVADO

    Formaliza cómo componer restricciones sin convertir el éxito de una tarea en prueba suficiente de fiabilidad.

    FRONTERA

    Los teoremas dependen de que políticas, contexto y metadatos estén correctamente representados. El workload es finito y quedan abiertas delegación dinámica, perfiles incomparables y efectos remotos.

    ABRIR EVIDENCIA LOCALIZABLE3 claims +
    1. La composición produce el estado menos restrictivo que satisface simultáneamente las políticas gobernantes.

      Composición por joins, intersecciones, narrowing y acumulación de evidencia · baseline: RBAC y allowlists independientes · Perfil, herramientas, memoria, presupuesto, artefactos, aprobación y evidencia
    2. El runtime intervino en más eventos inseguros que el comparador.

      94.8% frente a 67.1% · baseline: RBAC + allowlist · 612 trazas, 1.936 eventos, cinco familias de workload
    3. El enforcement aumentó auditabilidad, pero con más latencia y menor finalización.

      Audit 71.9→98.6%; completion 90.7→86.9%; mediana 38→71 ms · baseline: RBAC + allowlist · Mismo workload de evaluación
    Fuente primaria ↗Próxima prueba: Inyectar errores de scopes y criticidad durante árboles multiagente de profundidad 1–5; bloquear ante cualquier ampliación silenciosa de herramientas, memoria, presupuesto o aprobación.
  4. 04 / MEMORY / DIAGNOSIS19 AGO 2026 · arXiv v2

    D²ACCI

    Muestra que la memoria debe conservar no sólo contenido, sino trazas suficientes para explicar y recuperar una ejecución.

    HALLAZGO OBSERVADO

    Desplaza la evaluación desde una métrica final hacia gates, slices protegidos y localización de causas.

    FRONTERA

    La auditoría de causas usa 60 casos y modelos concretos. Las ablaciones no se replican todavía en todos los benchmarks.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. Mantener recuperación de memoria de sesión mejoró LongMemEval.

      +3.67 puntos porcentuales; 90.94% frente a 87.27% · baseline: No Session · LongMemEval, n=500, comparación pareada
    2. reported-result§4.3, Tabla 2

      Las trazas enriquecidas localizaron causas de fallo con mayor concordancia que answer+score aislados.

      Cohen κ .571 frente a .258 · baseline: Resultado y score únicamente · Paquete de auditoría de 60 casos
    Fuente primaria ↗Próxima prueba: Introducir un fallo tras persistir un checkpoint y comprobar con el mismo runKey que la decisión, los hashes y los conteos se conservan sin duplicados.
  5. 05 / SECURITY / EVOLUTION18 AGO 2026 · arXiv v1

    Self-Evolution Audit

    Aporta el contraejemplo operativo: un agente puede parecer seguro o inútil porque el artefacto que aprendió no coincide con la interfaz que realmente ejecuta.

    HALLAZGO OBSERVADO

    Obliga a separar utilidad, deriva de seguridad, cambios no autorizados y compatibilidad artefacto–ejecutor.

    FRONTERA

    Un único ejecutor y un entorno bancario simulado. Una única evolución offline y sin atribución causal aislada por representación.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. SkillOpt aumentó utilidad, pero también exposición a ataques y cambios financieros no autorizados.

      Utilidad +9.6 pp; exposición +12.3 pp; estado no autorizado +10.2 pp · baseline: Utility .741; exposure .820; unauthorized state .583 · AgentDojo Banking corregido; benign n=135, ataques n=405
    2. Una incompatibilidad de formato hizo que acciones textuales no produjeran ninguna llamada real.

      380/540 rollouts; 70.4% · baseline: Ejecutor que requería function calling nativo · AWM-LiteralPort con bloques <action> textuales
    Fuente primaria ↗Próxima prueba: Ejecutar canarios de interfaz sobre cada artefacto congelado con el ejecutor original y el de despliegue; bloquear si una acción declarada no produce la llamada equivalente.
  6. 06 / EVIDENCE / ABSTENTION18 AGO 2026 · arXiv v1

    Judge / Retrieve / Abstain

    Da una salida explícita a la incertidumbre: juzgar, recuperar y abstenerse son estados distintos, no etapas que siempre terminan en aceptación.

    HALLAZGO OBSERVADO

    Ofrece un patrón para medir cobertura y riesgo cuando la recuperación puede resolver o empeorar la incertidumbre.

    FRONTERA

    La garantía depende de exchangeability y del snapshot usado para calibrar. Cambiar tarea, modelo o calidad de recuperación exige recalibración.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§5.4, Tabla 2

      La recuperación calibrada elevó la cobertura sin superar el límite de riesgo configurado.

      82% de instancias aceptadas frente a 7% · baseline: Mode 1 Only · NQ-Open; α=.20; top-k=3; 100 particiones calibración-test
    2. Recuperar aumentó la incertidumbre en una fracción material de los casos y debe poder acabar en abstención.

      14.3%–29.1% según benchmark · baseline: Entropía antes de recuperar · TriviaQA, NQ-Open, PopQA y HotpotQA
    Fuente primaria ↗Próxima prueba: Evaluar un conjunto congelado con fuentes ausentes, contradictorias, irrelevantes y controles respondibles; medir FDR, cobertura, abstención correcta y precisión de citas.
  7. 07 / MEMORY / EVALUATION20 AGO 2026 · arXiv v1

    MemTrapBench

    Limita la tesis fácil de que la memoria siempre ayuda: una memoria relevante puede fijar un razonamiento o distorsionar una creencia.

    HALLAZGO OBSERVADO

    Introduce slices de trampas cognitivas y obliga a comparar memoria contra no-memory antes de promover una política de recuperación.

    FRONTERA

    Las trampas son diseñadas y no se mide su prevalencia natural. La evaluación cubre dos familias de modelos y depende en parte de jueces LLM.

    ABRIR EVIDENCIA LOCALIZABLE3 claims +
    1. reported-result§3.2, Tabla 1

      La mejor estrategia de memoria quedó por debajo de no usar memoria en ambos modelos.

      Gemini −13.99 pp; Qwen −15.36 pp · baseline: No memory: 85.16% y 81.83% · Cuatro escenarios de reasoning fixation y belief distortion
    2. reported-result§3.4, Tabla 4

      Introducir sólo el 25% del historial trap-inducing provocó la mayor caída, y ampliarlo empeoró más el resultado.

      92.29% sin memoria → 36.03% con 25% → 31.05% con 100% · baseline: No memory · Ablación de longitud sobre Task Boundary
    3. La memoria no debe promoverse por mejorar sólo el slice con trampas: debe conservar controles sin trampa y comparación contra no-memory.

      Regla editorial derivada del protocolo · baseline: Promoción por score agregado · Slices beneficioso, dañino y neutral
    Fuente primaria ↗Próxima prueba: Aplicar retrieve → challenge-memory → use/ignore sobre ejemplos trap, trap-free y LongMemEval; no promover si mejora un slice y pierde frente a no-memory en otro protegido.
  8. 08 / INTERFACE / RECOVERY17 AGO 2026 · arXiv v1

    MUSE

    Trata la interfaz de observabilidad como parte del sistema: una traza jerárquica puede convertirse en advertencia, diagnóstico y reparación situada.

    HALLAZGO OBSERVADO

    Conecta la forma de presentar eventos con la capacidad humana de recuperar una trayectoria.

    FRONTERA

    Estudio pequeño: 15 participantes y seis tareas controladas. La ventaja frente a DiLLS no fue estadísticamente significativa y la muestra no representa a operadores expertos.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§7.1.1, Tabla 4

      MUSE redujo el tiempo medio de finalización frente a logs crudos.

      17 frente a 25 minutos; −35% · baseline: Raw Logs · Between-subjects, n=15, seis tareas de data science
    2. La reparación contextualizada resolvió más advertencias que la misma detección sin reparación in situ.

      2.8 frente a 0.8 advertencias por participante · baseline: DiLLS sin repair contextual · Condiciones B y C con detección comparable
    Fuente primaria ↗Próxima prueba: Comparar logs crudos, resumen jerárquico y dossier accionable sobre fallos idénticos; medir tiempo a diagnóstico, repairs verificadas, reinicios y falsos repairs.
  9. 09 / MULTIMODAL / EVIDENCE19 AGO 2026 · arXiv v1

    DentAgent

    Aporta un blackboard de evidencia que conserva cobertura, huecos y conflictos antes de generar la respuesta.

    HALLAZGO OBSERVADO

    Muestra en un dominio multimodal que Identify–Delegate–Observe–Verify es más informativo que una primera pasada sin comprobación.

    FRONTERA

    Evaluación retrospectiva en cuatro benchmarks, sin validación clínica prospectiva. Parte de la evaluación usa un juez GPT-5-mini y no especialistas ciegos.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§IV-D, Figura 2

      La ejecución agéntica de una pasada mejora frente a inferencia directa.

      +17.48 puntos de model-judge score · baseline: Inferencia directa · MMOralBench; Qwen3.5-9B y herramientas constantes
    2. Restaurar el ciclo iterativo Identify–Delegate–Observe–Verify mejora sobre single-pass.

      48.40 → 52.83; +4.43 puntos · baseline: Single-pass agentic execution · MMOralBench; mismo backbone y toolset
    Fuente primaria ↗Próxima prueba: Comparar inferencia directa, single-pass y ciclo completo en un estudio prospectivo ciego; medir sensibilidad, especificidad, calibración, conflictos, coste y tiempo.
  10. 10 / AGENTS / VERIFICATION19 AGO 2026 · arXiv v1

    SemaPLC

    Traslada la compuerta de evidencia al código industrial: una tarea sólo termina cuando pasan especificación, compilación y comportamiento runtime.

    HALLAZGO OBSERVADO

    Aporta una referencia clara para medir la mejora de un harness y su coste de interacción.

    FRONTERA

    Los escenarios dinámicos son acotados y la ventaja se reduce con el modelo más fuerte. La verificación formal queda inconclusa en 174 propiedades de 32 programas con temporizadores TON.

    ABRIR EVIDENCIA LOCALIZABLE3 claims +
    1. El harness completo mejora la tasa media de aprobación estrictamente verificada.

      72.6% frente a 55.3%; +17.3 pp · baseline: Configuración bare · 117 tareas function-track; siete modelos de cinco proveedores
    2. El comportamiento dinámico medio supera a los baselines.

      52.2 frente a 31.4; +20.8 pp · baseline: AutoPLC, mejor baseline medio · 65 tareas project-track; fallos de compilación, despliegue o trazas puntúan cero
    3. Añadir gates mejora el score dinámico, pero incrementa tokens y solicitudes.

      23.1 → 54.1; 34k → 129k tokens; 8.9 → 47.8 requests · baseline: Sin capas de verificación · Ablation project-track; 65 tareas
    Fuente primaria ↗Próxima prueba: Generar escenarios ocultos con timers y transiciones entre scans; aceptar sólo si la ventaja dinámica supera 5 puntos sin fallos peligrosos no detectados.
  11. 11 / EVALUATION / COSTE20 AGO 2026 · arXiv v1

    Task-CoEvolve

    Aporta la dimensión económica que falta en un gate: la selección adaptativa puede reservar evidencia para las tareas que realmente discriminan entre harnesses.

    HALLAZGO OBSERVADO

    Conecta rigor y presupuesto sin asumir que evaluar todo en cada iteración sea la opción más fiable.

    FRONTERA

    La asignación es fija antes de observar resultados y no detiene temprano candidatos claramente inferiores. Con presupuestos muy pequeños pierde capacidad de ranking.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§4.4, Tabla 2

      Con el 20% del pool por iteración casi iguala la búsqueda completa.

      51.7% frente a 52.8%; −1.1 pp · baseline: Meta-Harness Full Search al 100% · Terminal-Bench 2.1; 89 tareas
    2. reported-result§4.5, Tabla 3

      Reduce el coste de búsqueda declarado con GPT-5.6-Luna.

      2.888M → 579M tokens; $117 → $30; 22.2 → 11.5 h · baseline: Full Search, 890 trials · Terminal-Bench 2.1; Task-CoEvolve 180 trials
    Fuente primaria ↗Próxima prueba: Comparar presupuesto fijo contra asignación secuencial con intervalos de confianza y conjunto final sellado; exigir regret ≤1.5 puntos y al menos 25% menos coste.
  12. 12 / INTERFACE / CONTEXT21 AGO 2026 · arXiv v1

    Structure for Reading / Prose for Writing

    Califica la idea de que más estructura siempre ayuda: el markup mejora lectura, pero puede perjudicar el material que condiciona la escritura.

    HALLAZGO OBSERVADO

    Sugiere separar la interfaz de recuperación de la interfaz de generación, en vez de usar un único formato para todo el ciclo.

    FRONTERA

    La comparación principal usa una sola licitación y un juez LLM de la misma familia del generador. La generalización a modelos frontier y evaluación humana ciega queda sin probar.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. El markup estructurado mejora cobertura y reproducibilidad en tareas de lectura.

      Annotation routing 61% → 97.8% · baseline: Texto plano · Tres tareas instrumentadas de lectura
    2. reported-result§3.5, Tabla 4

      Aplicar XML anidado al material usado para escribir empeora la respuesta respecto a prosa.

      23/31 veredictos favorables en prosa frente a 15/31 en XML · baseline: Mismas instrucciones en prosa · 31 respuestas por brazo; contenido y tamaño constantes
    Fuente primaria ↗Próxima prueba: Repetir el factorial prosa/markup en varios dominios, modelos y jueces independientes; medir cobertura, calidad, claims no soportados, restatement y acuerdo.
04CONEXIONES / QUÉ SE PUEDE LEER JUNTOS

El mapa dice cómo leerlos juntos.

Una relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.

MemTrapBenchqualifiesD²ACCI
Efecto de recuperar memoria sobre la respuesta · confianza 0.99

La memoria puede mejorar cuando conserva hechos necesarios y perjudicar cuando introduce fijación o autoridad obsoleta; no es una contradicción directa porque cambian benchmark y contenido.

DentAgentsupportsSemaPLC
Verificación iterativa frente a primera pasada · confianza 0.97

Dos dominios muestran en la misma dirección que integrar Identify–Delegate–Observe–Verify o gates de runtime mejora el resultado.

Policy AlgebraqualifiesSkillEffect
Enforcement previo a conceder autoridad · confianza 0.98

El enforcement puede elevar seguridad, pero también introducir latencia, falsas intervenciones y menor finalización.

Self-Evolution AuditsupportsSkillEffect
Validación de interfaz antes de ejecutar · confianza 0.98

El mismatch artefacto–ejecutor justifica un gate que compruebe la relación real entre propuesta, ejecutor y postcondición.

Structure for ReadingqualifiesWorking Set
Disponibilidad y representación del contexto · confianza 0.98

Tener el hecho disponible no basta: la representación debe adaptarse a si el agente está leyendo o escribiendo.

MUSEsupportsD²ACCI
Trazas para diagnóstico y recovery · confianza 0.97

La observabilidad estructurada convierte logs en diagnósticos reparables y mejora la localización de causas.

Judge / Retrieve / AbstainqualifiesSemaPLC
Gates y decisión posterior a la evidencia · confianza 0.96

Verificar más puede mejorar la calidad, pero no justifica aceptar automáticamente: debe existir una salida explícita de abstención.

Task-CoEvolveextendsSemaPLC
Coste de validación en harnesses · confianza 0.94

La selección adaptativa conserva señal de validación reduciendo parte del coste que introducen gates intensivos.

COMPARACIONES DESCARTADAS5 límites de interpretación +

MemTrapBench contradicts D²ACCI: rechazado; comparan memoria trap-inducing con memoria de sesión útil.

Judge/Retrieve/Abstain contradicts SemaPLC: rechazado; mecanismos y tareas no comparten eje experimental.

Policy Algebra contradicts SkillEffect: rechazado; dominios, runtimes y presupuestos distintos.

Working Set contradicts Structure for Reading: rechazado; disponibilidad causal y formato no son proposiciones incompatibles.

Self-Evolution Audit contradicts Policy Algebra: rechazado; deriva de seguridad y enforcement responden a preguntas diferentes.

04BCONCEPTOS VIVOS

7 ideas, con el candidato separado.

Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.

EXTENSIÓN6 PAPERS

Evidence gates antes del reasoning

La evidencia deja de ser contexto pasivo y decide si ejecutar, recuperar, verificar, abstenerse o aceptar.

Apoyo: Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffectFalta: Falta una métrica común que combine riesgo, cobertura, coste y latencia.
EXTENSIÓN3 PAPERS

La política como interfaz de ejecución

Autoridad, presupuesto, evidencia y postcondiciones forman parte del contrato que interpreta y valida el agente.

Apoyo: Policy Algebra, SkillEffect y Self-Evolution AuditFalta: Falta demostrar no escalada bajo delegación dinámica y efectos remotos.
EXTENSIÓN5 PAPERS

La memoria como política de recuperación

La memoria ayuda cuando conserva hechos necesarios y actuales, pero perjudica si introduce fijación, obsolescencia o autoridad indebida.

Apoyo: D²ACCI, Working Set, MemTrapBench y Judge/Retrieve/AbstainFalta: Falta una evaluación conjunta con slices beneficiosos, dañinos y neutrales.
EXTENSIÓN4 PAPERS

Recovery selectivo

La recuperación útil localiza un fallo concreto y aplica una intervención limitada en vez de reiniciar todo el sistema.

Apoyo: D²ACCI, MUSE, Judge/Retrieve/Abstain y DentAgentFalta: Faltan comparaciones con retry ciego y garantías comunes de idempotencia.
EXTENSIÓN5 PAPERS

Trazas de runtime y assurance

El resultado final no basta: llamadas reales, eventos, gates y cambios de estado explican y aseguran la ejecución.

Apoyo: D²ACCI, Self-Evolution Audit, Policy Algebra, MUSE y SemaPLCFalta: Falta un esquema interoperable de eventos y replay determinista.
EXTENSIÓN5 PAPERS

La interfaz como parte del modelo

Cambiar la interfaz de información, representación o ejecución puede cambiar la capacidad sin cambiar el modelo base.

Apoyo: Self-Evolution Audit, Structure for Reading, MUSE, Working Set y SkillEffectFalta: Hay que separar efectos de formato, orden y autoridad.
CANDIDATO3 PAPERS

Economía de la verificación

La verificación debe asignarse como un presupuesto: más gates consumen tokens, dinero y latencia.

Apoyo: SemaPLC, Task-CoEvolve y Policy AlgebraFalta: Sólo aparece en este corte; necesita soporte independiente en otra semana.
FRONTERA DE CONFIANZA

El corte orienta una prueba; no demuestra una adopción.

Dossier editorial provisional. Las fuentes primarias, versiones y localizadores fueron comprobados por lectores externos; el paquete todavía no es una corrida canónica persistida porque la sesión autenticada necesaria para escribir en MCP no estuvo disponible.

SIGUIENTE PRUEBA

Persistir y reproducir la corrida sin fingir que el dossier ya es canónico.

Medir: IDs, conteos, hashes, precisión de citas, abstención correcta, duración por etapa y coste con costStatus=unknown si el proveedor no lo entrega.

Parar si: No promover a published si hay pérdida de estado, duplicados, locator roto, source-pending usado como evidencia o ampliación silenciosa de permisos.

Abrir bundle para agentes