Leer, comprobar, abstenerse.
Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.
Doce fuentes primarias convergen en una arquitectura más exigente: memoria, recuperación, interfaces y verificación sólo aportan valor cuando el sistema puede demostrar qué leyó, qué comprobó, qué coste asumió y cuándo debe abstenerse.
¿Qué cambia cuando un agente debe superar compuertas explícitas de evidencia antes de ejecutar, recordar o publicar una conclusión?
Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.
D²ACCI y Working Set muestran cuándo conservar hechos ayuda; MemTrapBench muestra cuándo una memoria aparentemente relevante fija errores o autoridad caducada.
MUSE, D²ACCI y Self-Evolution Audit hacen visible la distancia entre lo que el agente dijo, lo que el runtime ejecutó y lo que otro agente puede recuperar.
Policy Algebra y SemaPLC muestran el coste de verificar; Task-CoEvolve propone asignar más evaluación donde todavía discrimina entre harnesses.
La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.
Define el contrato más concreto de la compuerta: una propuesta del modelo no recibe autoridad hasta que un checker reconstruye semántica, límite y postcondición.
Convierte una instrucción de uso eficiente en una frontera verificable entre propuesta, lowering acotado, ejecución y publicación.
Cubre seis plugins y cinco patrones de ejecución local, determinista y de sólo lectura. Los efectos remotos como pagos o emails necesitan un protocolo de transacción e idempotencia adicional.
La autoridad sólo se concede cuando hay una única relación aceptada, el límite cabe en el presupuesto y la publicación supera postcondiciones y controles físicos.
Contrato proposal → check → execute · baseline: Ejecución directa o propuesta no verificada · Runtime de herramientas locales con capacidad acotadaEl lowering acotado completó todas las tareas desde un límite de 128 MiB.
24/24 tareas; AUC 0.950 · baseline: Ejecución directa: AUC 0.467; C90=2048 MiB · 24 tareas, seis familias, caps de 64 a 2048 MiB, tres repeticionesEl checker aceptó todas las configuraciones legales y rechazó todas las propuestas adversariales evaluadas.
60/60 aceptadas; 500/500 rechazadas · baseline: Mutaciones de semántica, recursos y bindings · Matriz congelada de cinco relacionesAporta una explicación causal para la memoria operativa: el agente falla cuando el hecho necesario no está disponible mientras escribe, no simplemente cuando ha leído poco.
Introduce la idea de coherence debt y muestra que disponibilidad, autoridad y frescura del contexto importan más que el volumen bruto de lectura.
La mayoría de workloads son migraciones sintéticas y el estado interno del agente sólo se observa mediante proxies. El contraste no separa por completo autoridad, modalidad y orden de lectura.
Sin workspace ni conocimiento previo específico, ninguna prueba resolvió la migración; al suministrar reglas y fuente, casi todas alcanzaron al menos 9 de 12 requisitos.
0/154 frente a 299/300 pruebas · baseline: Novel closed-book · Migraciones de API con disponibilidad de hechos como variableRetirar hechos elimina exactamente el trabajo que esos hechos sostenían.
32, 24, 16, 8, 0 tests al retirar 0, 2, 4, 6, 8 hechos · baseline: 32/32 con todos los hechos · Fault injection con archivo eliminado o stub de igual longitudAnte un estándar escrito obsoleto y código funcional, los agentes siguieron el estándar y tomaron peores decisiones que sin estándar.
39/39 conflictos siguieron el documento · baseline: Sin estándar: 33% de decisiones en la forma mejor · Conflictos entre convención escrita y códigoExtiende la compuerta de evidencia a identidad, permisos, presupuesto, memoria, aprobación y auditoría: la capacidad fiable es una propiedad de la trayectoria.
Formaliza cómo componer restricciones sin convertir el éxito de una tarea en prueba suficiente de fiabilidad.
Los teoremas dependen de que políticas, contexto y metadatos estén correctamente representados. El workload es finito y quedan abiertas delegación dinámica, perfiles incomparables y efectos remotos.
La composición produce el estado menos restrictivo que satisface simultáneamente las políticas gobernantes.
Composición por joins, intersecciones, narrowing y acumulación de evidencia · baseline: RBAC y allowlists independientes · Perfil, herramientas, memoria, presupuesto, artefactos, aprobación y evidenciaEl runtime intervino en más eventos inseguros que el comparador.
94.8% frente a 67.1% · baseline: RBAC + allowlist · 612 trazas, 1.936 eventos, cinco familias de workloadEl enforcement aumentó auditabilidad, pero con más latencia y menor finalización.
Audit 71.9→98.6%; completion 90.7→86.9%; mediana 38→71 ms · baseline: RBAC + allowlist · Mismo workload de evaluaciónMuestra que la memoria debe conservar no sólo contenido, sino trazas suficientes para explicar y recuperar una ejecución.
Desplaza la evaluación desde una métrica final hacia gates, slices protegidos y localización de causas.
La auditoría de causas usa 60 casos y modelos concretos. Las ablaciones no se replican todavía en todos los benchmarks.
Mantener recuperación de memoria de sesión mejoró LongMemEval.
+3.67 puntos porcentuales; 90.94% frente a 87.27% · baseline: No Session · LongMemEval, n=500, comparación pareadaLas trazas enriquecidas localizaron causas de fallo con mayor concordancia que answer+score aislados.
Cohen κ .571 frente a .258 · baseline: Resultado y score únicamente · Paquete de auditoría de 60 casosAporta el contraejemplo operativo: un agente puede parecer seguro o inútil porque el artefacto que aprendió no coincide con la interfaz que realmente ejecuta.
Obliga a separar utilidad, deriva de seguridad, cambios no autorizados y compatibilidad artefacto–ejecutor.
Un único ejecutor y un entorno bancario simulado. Una única evolución offline y sin atribución causal aislada por representación.
SkillOpt aumentó utilidad, pero también exposición a ataques y cambios financieros no autorizados.
Utilidad +9.6 pp; exposición +12.3 pp; estado no autorizado +10.2 pp · baseline: Utility .741; exposure .820; unauthorized state .583 · AgentDojo Banking corregido; benign n=135, ataques n=405Una incompatibilidad de formato hizo que acciones textuales no produjeran ninguna llamada real.
380/540 rollouts; 70.4% · baseline: Ejecutor que requería function calling nativo · AWM-LiteralPort con bloques <action> textualesDa una salida explícita a la incertidumbre: juzgar, recuperar y abstenerse son estados distintos, no etapas que siempre terminan en aceptación.
Ofrece un patrón para medir cobertura y riesgo cuando la recuperación puede resolver o empeorar la incertidumbre.
La garantía depende de exchangeability y del snapshot usado para calibrar. Cambiar tarea, modelo o calidad de recuperación exige recalibración.
La recuperación calibrada elevó la cobertura sin superar el límite de riesgo configurado.
82% de instancias aceptadas frente a 7% · baseline: Mode 1 Only · NQ-Open; α=.20; top-k=3; 100 particiones calibración-testRecuperar aumentó la incertidumbre en una fracción material de los casos y debe poder acabar en abstención.
14.3%–29.1% según benchmark · baseline: Entropía antes de recuperar · TriviaQA, NQ-Open, PopQA y HotpotQALimita la tesis fácil de que la memoria siempre ayuda: una memoria relevante puede fijar un razonamiento o distorsionar una creencia.
Introduce slices de trampas cognitivas y obliga a comparar memoria contra no-memory antes de promover una política de recuperación.
Las trampas son diseñadas y no se mide su prevalencia natural. La evaluación cubre dos familias de modelos y depende en parte de jueces LLM.
La mejor estrategia de memoria quedó por debajo de no usar memoria en ambos modelos.
Gemini −13.99 pp; Qwen −15.36 pp · baseline: No memory: 85.16% y 81.83% · Cuatro escenarios de reasoning fixation y belief distortionIntroducir sólo el 25% del historial trap-inducing provocó la mayor caída, y ampliarlo empeoró más el resultado.
92.29% sin memoria → 36.03% con 25% → 31.05% con 100% · baseline: No memory · Ablación de longitud sobre Task BoundaryLa memoria no debe promoverse por mejorar sólo el slice con trampas: debe conservar controles sin trampa y comparación contra no-memory.
Regla editorial derivada del protocolo · baseline: Promoción por score agregado · Slices beneficioso, dañino y neutralTrata la interfaz de observabilidad como parte del sistema: una traza jerárquica puede convertirse en advertencia, diagnóstico y reparación situada.
Conecta la forma de presentar eventos con la capacidad humana de recuperar una trayectoria.
Estudio pequeño: 15 participantes y seis tareas controladas. La ventaja frente a DiLLS no fue estadísticamente significativa y la muestra no representa a operadores expertos.
MUSE redujo el tiempo medio de finalización frente a logs crudos.
17 frente a 25 minutos; −35% · baseline: Raw Logs · Between-subjects, n=15, seis tareas de data scienceLa reparación contextualizada resolvió más advertencias que la misma detección sin reparación in situ.
2.8 frente a 0.8 advertencias por participante · baseline: DiLLS sin repair contextual · Condiciones B y C con detección comparableAporta un blackboard de evidencia que conserva cobertura, huecos y conflictos antes de generar la respuesta.
Muestra en un dominio multimodal que Identify–Delegate–Observe–Verify es más informativo que una primera pasada sin comprobación.
Evaluación retrospectiva en cuatro benchmarks, sin validación clínica prospectiva. Parte de la evaluación usa un juez GPT-5-mini y no especialistas ciegos.
La ejecución agéntica de una pasada mejora frente a inferencia directa.
+17.48 puntos de model-judge score · baseline: Inferencia directa · MMOralBench; Qwen3.5-9B y herramientas constantesRestaurar el ciclo iterativo Identify–Delegate–Observe–Verify mejora sobre single-pass.
48.40 → 52.83; +4.43 puntos · baseline: Single-pass agentic execution · MMOralBench; mismo backbone y toolsetTraslada la compuerta de evidencia al código industrial: una tarea sólo termina cuando pasan especificación, compilación y comportamiento runtime.
Aporta una referencia clara para medir la mejora de un harness y su coste de interacción.
Los escenarios dinámicos son acotados y la ventaja se reduce con el modelo más fuerte. La verificación formal queda inconclusa en 174 propiedades de 32 programas con temporizadores TON.
El harness completo mejora la tasa media de aprobación estrictamente verificada.
72.6% frente a 55.3%; +17.3 pp · baseline: Configuración bare · 117 tareas function-track; siete modelos de cinco proveedoresEl comportamiento dinámico medio supera a los baselines.
52.2 frente a 31.4; +20.8 pp · baseline: AutoPLC, mejor baseline medio · 65 tareas project-track; fallos de compilación, despliegue o trazas puntúan ceroAñadir gates mejora el score dinámico, pero incrementa tokens y solicitudes.
23.1 → 54.1; 34k → 129k tokens; 8.9 → 47.8 requests · baseline: Sin capas de verificación · Ablation project-track; 65 tareasAporta la dimensión económica que falta en un gate: la selección adaptativa puede reservar evidencia para las tareas que realmente discriminan entre harnesses.
Conecta rigor y presupuesto sin asumir que evaluar todo en cada iteración sea la opción más fiable.
La asignación es fija antes de observar resultados y no detiene temprano candidatos claramente inferiores. Con presupuestos muy pequeños pierde capacidad de ranking.
Con el 20% del pool por iteración casi iguala la búsqueda completa.
51.7% frente a 52.8%; −1.1 pp · baseline: Meta-Harness Full Search al 100% · Terminal-Bench 2.1; 89 tareasReduce el coste de búsqueda declarado con GPT-5.6-Luna.
2.888M → 579M tokens; $117 → $30; 22.2 → 11.5 h · baseline: Full Search, 890 trials · Terminal-Bench 2.1; Task-CoEvolve 180 trialsCalifica la idea de que más estructura siempre ayuda: el markup mejora lectura, pero puede perjudicar el material que condiciona la escritura.
Sugiere separar la interfaz de recuperación de la interfaz de generación, en vez de usar un único formato para todo el ciclo.
La comparación principal usa una sola licitación y un juez LLM de la misma familia del generador. La generalización a modelos frontier y evaluación humana ciega queda sin probar.
El markup estructurado mejora cobertura y reproducibilidad en tareas de lectura.
Annotation routing 61% → 97.8% · baseline: Texto plano · Tres tareas instrumentadas de lecturaAplicar XML anidado al material usado para escribir empeora la respuesta respecto a prosa.
23/31 veredictos favorables en prosa frente a 15/31 en XML · baseline: Mismas instrucciones en prosa · 31 respuestas por brazo; contenido y tamaño constantesUna relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.
La memoria puede mejorar cuando conserva hechos necesarios y perjudicar cuando introduce fijación o autoridad obsoleta; no es una contradicción directa porque cambian benchmark y contenido.
Dos dominios muestran en la misma dirección que integrar Identify–Delegate–Observe–Verify o gates de runtime mejora el resultado.
El enforcement puede elevar seguridad, pero también introducir latencia, falsas intervenciones y menor finalización.
El mismatch artefacto–ejecutor justifica un gate que compruebe la relación real entre propuesta, ejecutor y postcondición.
Tener el hecho disponible no basta: la representación debe adaptarse a si el agente está leyendo o escribiendo.
La observabilidad estructurada convierte logs en diagnósticos reparables y mejora la localización de causas.
Verificar más puede mejorar la calidad, pero no justifica aceptar automáticamente: debe existir una salida explícita de abstención.
La selección adaptativa conserva señal de validación reduciendo parte del coste que introducen gates intensivos.
MemTrapBench contradicts D²ACCI: rechazado; comparan memoria trap-inducing con memoria de sesión útil.
Judge/Retrieve/Abstain contradicts SemaPLC: rechazado; mecanismos y tareas no comparten eje experimental.
Policy Algebra contradicts SkillEffect: rechazado; dominios, runtimes y presupuestos distintos.
Working Set contradicts Structure for Reading: rechazado; disponibilidad causal y formato no son proposiciones incompatibles.
Self-Evolution Audit contradicts Policy Algebra: rechazado; deriva de seguridad y enforcement responden a preguntas diferentes.
Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.
La evidencia deja de ser contexto pasivo y decide si ejecutar, recuperar, verificar, abstenerse o aceptar.
Apoyo: Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffectFalta: Falta una métrica común que combine riesgo, cobertura, coste y latencia.Autoridad, presupuesto, evidencia y postcondiciones forman parte del contrato que interpreta y valida el agente.
Apoyo: Policy Algebra, SkillEffect y Self-Evolution AuditFalta: Falta demostrar no escalada bajo delegación dinámica y efectos remotos.La memoria ayuda cuando conserva hechos necesarios y actuales, pero perjudica si introduce fijación, obsolescencia o autoridad indebida.
Apoyo: D²ACCI, Working Set, MemTrapBench y Judge/Retrieve/AbstainFalta: Falta una evaluación conjunta con slices beneficiosos, dañinos y neutrales.La recuperación útil localiza un fallo concreto y aplica una intervención limitada en vez de reiniciar todo el sistema.
Apoyo: D²ACCI, MUSE, Judge/Retrieve/Abstain y DentAgentFalta: Faltan comparaciones con retry ciego y garantías comunes de idempotencia.El resultado final no basta: llamadas reales, eventos, gates y cambios de estado explican y aseguran la ejecución.
Apoyo: D²ACCI, Self-Evolution Audit, Policy Algebra, MUSE y SemaPLCFalta: Falta un esquema interoperable de eventos y replay determinista.Cambiar la interfaz de información, representación o ejecución puede cambiar la capacidad sin cambiar el modelo base.
Apoyo: Self-Evolution Audit, Structure for Reading, MUSE, Working Set y SkillEffectFalta: Hay que separar efectos de formato, orden y autoridad.La verificación debe asignarse como un presupuesto: más gates consumen tokens, dinero y latencia.
Apoyo: SemaPLC, Task-CoEvolve y Policy AlgebraFalta: Sólo aparece en este corte; necesita soporte independiente en otra semana.Dossier editorial provisional. Las fuentes primarias, versiones y localizadores fueron comprobados por lectores externos; el paquete todavía no es una corrida canónica persistida porque la sesión autenticada necesaria para escribir en MCP no estuvo disponible.
Medir: IDs, conteos, hashes, precisión de citas, abstención correcta, duración por etapa y coste con costStatus=unknown si el proveedor no lo entrega.
Parar si: No promover a published si hay pérdida de estado, duplicados, locator roto, source-pending usado como evidencia o ampliación silenciosa de permisos.
Abrir bundle para agentes ↗