NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 35 · SEP 2026
7—13 SEP 202615 LECTURAS PRIMARIAS0 EN COLA21 CLAIMS

La capacidad del agente también depende de cómo se verifica.

Quince trabajos desplazan la unidad de calidad: no basta con medir el modelo. Hay que auditar el benchmark, observar todos los canales de ejecución, comprobar la interfaz real y decidir cuándo recuperar o abstenerse.

ESTADO EDITORIAL15 fuentes primarias abiertas · 0 señales scout sin claims
EN UNA FRASE

La evidencia del corte favorece sistemas que convierten verificación, memoria y procedimientos en políticas explícitas; también muestra que cada compuerta puede introducir coste, fragilidad o una falsa sensación de seguridad.

PREGUNTA QUE GUÍA EL CORTE

¿Qué cambia cuando la evaluación incluye benchmark, memoria, retrieval, interfaz, trazas, tests y coste como partes del mismo sistema?

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / COMPUERTAS DE EVIDENCIA

Leer, comprobar, abstenerse.

Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.

02 / POLÍTICA DE MEMORIA

Más memoria no es mejor memoria.

D²ACCI y Working Set muestran cuándo conservar hechos ayuda; MemTrapBench muestra cuándo una memoria aparentemente relevante fija errores o autoridad caducada.

03 / RECOVERY TRAZABLE

El resultado final no explica el fallo.

MUSE, D²ACCI y Self-Evolution Audit hacen visible la distancia entre lo que el agente dijo, lo que el runtime ejecutó y lo que otro agente puede recuperar.

04 / ECONOMÍA DE LA VERIFICACIÓN

Rigor con presupuesto.

Policy Algebra y SemaPLC muestran el coste de verificar; Task-CoEvolve propone asignar más evaluación donde todavía discrimina entre harnesses.

02LEDGER DE FUENTES / QUÉ SOSTIENE LA TESIS

Cada paper aparece una vez: papel, hallazgo y frontera.

La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.

  1. 01 / EVALUACIÓN / RAZONAMIENTO11 SEP 2026 · arXiv v1

    Physics benchmark audit

    Audita si un benchmark está midiendo errores del modelo o errores del propio instrumento.

    HALLAZGO OBSERVADO

    La auditoría cambia el score y atribuye 148/152 fallos revisados al benchmark o al grader.

    FRONTERA

    Los conjuntos post-audit no son idénticos a los conjuntos originales. La muestra parte principalmente de fallos aparentes y no estima todos los errores.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. Tras validación y reparación experta, GPT-5.6-Sol pasó de 47.28% a 78.66% mean@4 en HLE-Physics y de 61.00% a 87.24% en CMT-Benchmark.

      47.28→78.66%; 61.00→87.24% · baseline: Evaluación pre-audit · Tres modelos; HLE: 202 preguntas originales y 116 retenidas; CMT: 50 originales y 49 retenidas; cuatro intentos.
    2. En tres audit sets públicos, 148 de 152 casos auditados se atribuyeron a errores del benchmark o del grader y 4 a errores del modelo.

      97.37% benchmark/grader; 2.63% modelo · baseline: Casos inicialmente marcados como incorrectos · Subconjuntos condicionados a fallos aparentes de cuatro intentos.
    Fuente primaria ↗Próxima prueba: No extrapolar el resultado a razonamiento físico abierto; repetir con conjuntos retenidos, jueces independientes y tareas no seleccionadas.
  2. 02 / SEGURIDAD / AGENTES11 SEP 2026 · arXiv v1

    K-Bench

    Comprueba si el olvido medido en pesos cubre también prompt, retrieval, herramientas y trazas.

    HALLAZGO OBSERVADO

    Los canales no paramétricos pueden filtrar secretos aunque el probe de pesos indique olvido.

    FRONTERA

    El corpus principal usa PII sintética. Los sustratos se evalúan por separado y el scaffold no representa todas las arquitecturas.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. Con secretos en contexto o retrieval, los probes de pesos quedaron cerca de no-memorización, pero Llama-3.1-8B expuso 22.3% en contexto, 60.2% en R-text y 85.5% en R-struct; Qwen3.5-9B llegó a 99.2% en contexto.

      22.3–99.2% según canal y modelo · baseline: TOFU, MUSE, WMDP y LUME como probes paramétricos · Llama-3.1-8B, Qwen3.5-9B y Mistral-7B; seis canales observables.
    2. En ocho modelos servidos por API, el observador detectó fugas en las 24 combinaciones modelo/sustrato: OR(all) fue 0.270–1.000 en contexto, 0.160–0.710 en R-text y 0.335–0.965 en R-struct.

      24/24 combinaciones con fuga observada · baseline: Sin intervención; probes directos no aplicables a endpoints · Ocho endpoints, tres sustratos no paramétricos y 200 consultas por celda.
    Fuente primaria ↗Próxima prueba: Repetir con sustratos combinados, datos no sintéticos y canales específicos del runtime que se quiera certificar.
  3. 03 / RAG / CÓDIGO11 SEP 2026 · arXiv v1

    Enterprise Graph RAG

    Mide si preservar estructura del repositorio mejora la migración más allá de la similitud vectorial.

    HALLAZGO OBSERVADO

    La estructura reduce alucinación de API, pero introduce un coste medible en complejidad y docstrings.

    FRONTERA

    Sólo se estudia un repositorio Java→Python. No hay evidencia estadística de generalización a otras familias de generación.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§6, Table 1

      Graph RAG redujo la alucinación media de API de 56.4% a 16.2% y elevó la calidad ponderada de migración de 65.5% a 83.2%; CodeBLEU cambió de 90.6% a 91.1%.

      56.4→16.2%; 65.5→83.2%; CodeBLEU 90.6→91.1% · baseline: Standard RAG con chunks de 800, overlap 150 y top-5 cosine retrieval · spring-petclinic-genai; Java→Python; Gemini-2.5-pro; temperatura 0; hasta tres hops AST.
    2. Graph RAG redujo Cyclomatic Complexity Consistency de 71.6% a 46.7% y Docstring Preservation de 67.0% a 61.0%.

      CCC 71.6→46.7%; DP 67.0→61.0% · baseline: Standard RAG en el mismo modelo y repositorio · Misma migración Java→Python, evaluación agregada por archivos.
    Fuente primaria ↗Próxima prueba: Repetir sobre varios repositorios y añadir métricas estructurales al criterio de aceptación; no usar CodeBLEU como único indicador.
  4. 04 / RAZONAMIENTO / ENTRENAMIENTO10 SEP 2026 · arXiv v1

    Negative Self-Distillation

    Explora si el modelo puede mejorar alejándose de fallos autogenerados sin soluciones gold.

    HALLAZGO OBSERVADO

    El método mejora Qwen3 en matemáticas dentro del protocolo descrito, pero no prueba transferencia fuera de ese dominio.

    FRONTERA

    Sólo se evalúa Qwen3. El mejor checkpoint se selecciona dentro de dos épocas y sobre tareas matemáticas.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. reported-result§4.1, Table 1

      NSD mejoró Avg@8 frente al modelo base en +2.3, +7.5 y +6.0 puntos para Qwen3 de 1.7B, 4B y 8B; los IC95% permanecen positivos.

      +2.3/+7.5/+6.0 puntos · baseline: Qwen3 sin entrenamiento adicional · MATH; siete benchmarks matemáticos; dos épocas; modo non-thinking; ocho muestras por problema.
    2. reported-result§4.2, Table 2

      En Qwen3-4B, NSD produjo 7.5 tokens de reflexión por respuesta frente a 3.6 del baseline, 2.2 con OPSD y 0.8 con Intuitor.

      7.5 frente a 3.6 tokens · baseline: Modelo base y métodos comparadores · AIME 2024, AIME 2025 y HMMT 2025.
    Fuente primaria ↗Próxima prueba: Validar en dominios no matemáticos y separar la frecuencia de reflexión de la corrección real mediante jueces y pruebas independientes.
  5. 05 / RAG / ABSTENCIÓN10 SEP 2026 · arXiv v1

    Distribution-Shape QPP

    Predice si el retrieval es suficiente usando la forma de sus scores antes de invocar otro juez LLM.

    HALLAZGO OBSERVADO

    Una puerta de 2 ms compite con un juez LLM, pero pierde AUROC fuera de distribución.

    FRONTERA

    Se usa un retriever y un juez local. Falta validación con tráfico real y la variante robusta sacrifica AUROC in-domain.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. GeneralQPP/S1 alcanzó AUROC ponderado 0.856 en ViDoRe frente a 0.835 de Classic Full y 0.649 del juez Qwen3.5; su latencia fue 2.0 ms frente a 6.3 s.

      0.856 AUROC; 2.0 ms/query · baseline: Classic Full y juez local Qwen3.5-35B · 14,514 consultas, ocho dominios ViDoRe, split 80/20 y cinco semillas.
    2. En leave-one-domain-out, S1 cayó de 0.856 a 0.706 AUROC; S1-Lean recuperó hasta 0.719 y superó al baseline clásico en 0.032.

      0.856→0.706; S1-Lean 0.719 · baseline: S1 completo y Classic Full en transferencia OOD · ViDoRe LODO; S1-Lean con 13 features.
    Fuente primaria ↗Próxima prueba: Probar con tráfico real y calibrar un umbral de abstención por dominio antes de usarlo como gate de producción.
  6. 06 / AGENTES / MULTIMODAL9 SEP 2026 · arXiv v1

    JarvisGUI

    Expone el coste de transferir estado y dependencias entre dispositivos en tareas largas.

    HALLAZGO OBSERVADO

    La dependencia cross-device reduce TSR a 0–2% en el benchmark.

    FRONTERA

    Sólo modelos open-source y una arquitectura planner–grounder. El benchmark requiere entornos virtualizados específicos.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. En tareas multi-device con dependencias, los seis agentes obtuvieron TSR entre 0% y 2%; el mejor resultado fue 2%.

      0–2% TSR · baseline: Tareas atómicas y cross-platform independientes · 150 tareas: 50 single-platform dependientes, 50 cross-platform independientes y 50 cross-platform dependientes; Android, Windows y Ubuntu.
    Fuente primaria ↗Próxima prueba: Añadir canarios de transferencia de estado, permisos y recuperación entre dispositivos antes de evaluar la capacidad atómica.
  7. 07 / MEMORIA / RAZONAMIENTO9 SEP 2026 · arXiv v1

    ConvMem

    Usa una memoria jerárquica y paralela para agregar contexto largo sin una cadena secuencial completa.

    HALLAZGO OBSERVADO

    Mejora el resultado OOD en el protocolo evaluado, pero paga más cómputo total y depende de descomponer bien la consulta.

    FRONTERA

    El conjunto OOD es sintético y contiene un error de etiqueta documentado. La tabla principal no cuantifica de forma completa el coste total ni el error de descomposición.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. ConvMem superó a MemAgent en F1 en las seis longitudes de 28k–896k del benchmark OOD RULER-2WikiMultiHopQA.

      72.30–59.06 frente a 60.92–58.41 · baseline: MemAgent entrenado con RL · RULER-HotpotQA como entrenamiento; 2WikiMultiHopQA sintético como OOD; 28k–896k tokens.
    Fuente primaria ↗Próxima prueba: Medir coste total, errores de descomposición y transferencia a documentos reales antes de preferir memoria paralela.
  8. 08 / MEMORIA / AGENTES9 SEP 2026 · arXiv v1

    RD-Forget

    Separa lo que se conserva en el archivo de lo que queda elegible para una respuesta concreta.

    HALLAZGO OBSERVADO

    La vista de memoria condicionada por consulta supera las ablaciones y los baselines en 12 combinaciones.

    FRONTERA

    Dos benchmarks usan jueces del mismo modelo o familia. Las ablaciones cambian configuraciones completas y no aíslan un único mecanismo.

    ABRIR EVIDENCIA LOCALIZABLE2 claims +
    1. RD-Forget obtuvo la mayor exactitud en las 12 combinaciones de cuatro modelos por tres benchmarks.

      12/12 combinaciones; medias 66.59%, 86.71%, 77.13% y 72.83% · baseline: ACE y ReasoningBank · 264 tareas por método: 86 AMB-Text, 78 LME-KU y 100 MAB-FC; cuatro backbones.
    2. reported-result§4.4, Table 2

      Eliminar FORGET o esconder la pregunta al curador produce caídas grandes en los tres benchmarks de Luna.

      Full 91.86/93.59/74.00 → sin FORGET 68.60/60.26/51.00 · baseline: Configuración matched Full · GPT-5.6-Luna; 264 tareas emparejadas entre configuración completa y ablaciones.
    Fuente primaria ↗Próxima prueba: Validar con jueces independientes y con slices que contengan hechos actuales, obsoletos, contradictorios y sensibles.
  9. 09 / SEGURIDAD / EVALUACIÓN9 SEP 2026 · arXiv v1

    AgentAudit

    Evalúa planificación, memoria, herramientas, grounding y ataques como una trayectoria completa.

    HALLAZGO OBSERVADO

    La traza completa distingue tipos de fallo, pero el ranking queda limitado por juez único y una sola prueba por celda.

    FRONTERA

    Una prueba por modelo-tarea. El juez fijo también es uno de los modelos evaluados y los pesos del score no están calibrados empíricamente.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Claude Sonnet 5 obtuvo CTS medio 95.1 y GPT-5 80.6; los otros modelos quedaron entre 57.6 y 22.6.

      CTS 95.1 frente a 80.6 y 57.6–22.6 · baseline: Comparación entre cinco modelos · 5 modelos × 9 tareas = 45 ejecuciones; seis entornos; 10 métricas agregadas.
    Fuente primaria ↗Próxima prueba: Replicar con múltiples jueces, varias ejecuciones por celda y análisis de sensibilidad de pesos y umbrales.
  10. 10 / EMPRESA / EVALUACIÓN9 SEP 2026 · arXiv v1

    Era by Eon

    Construye un estate empresarial sintético con ground truth exacto para comparar agentes sin datos de clientes.

    HALLAZGO OBSERVADO

    El benchmark permite grading determinista, pero la mayoría de las diferencias puntuales del leaderboard no están respaldadas por evidencia suficiente.

    FRONTERA

    Una empresa sintética y 33 formas de pregunta. Los intervalos son amplios y no cubren todas las configuraciones descritas.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Las exactitudes estimadas abarcaron 42.4%–76.8%, pero sólo 3 de 36 comparaciones por pares aportaron evidencia suficiente para afirmar superioridad.

      42.4–76.8%; 3/36 pares respaldados · baseline: gpt-5.4-mini 42.4% [27.3,58.6]; claude-opus-4.8 76.8% [61.6,90.9] · 9 modelos; 33 preguntas; 3 repeticiones; 891 respuestas; estate sintético con Gong, Salesforce y Zendesk.
    Fuente primaria ↗Próxima prueba: Usar el estate como harness reproducible, pero publicar intervalos, cobertura de pares y answer keys junto al ranking.
  11. 11 / AGENTES / MEMORIA8 SEP 2026 · arXiv v1

    Procedural Graphs

    Representa procedimientos reutilizables como grafos editables que guían la ejecución y pueden evolucionar.

    HALLAZGO OBSERVADO

    La representación procedural gana dentro del protocolo comparado, sin demostrar superioridad universal en arquitecturas heterogéneas.

    FRONTERA

    Solver, guidance y refiner comparten LLM y la decodificación es greedy. El paper no presenta una sección explícita de limitaciones.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Procedural Graph quedó primero o empatado primero en 21/24 combinaciones modelo–benchmark; registró 19 victorias, 2 empates y 3 derrotas frente al mejor baseline, p=4.3×10⁻⁴.

      21/24; 19–2–3; p=4.3×10⁻⁴ · baseline: Mejor baseline de cada combinación entre siete métodos · Seis benchmarks × cuatro LLM; mismo solver ReAct; temperatura 0.
    Fuente primaria ↗Próxima prueba: Separar el efecto del grafo del efecto del mismo LLM, del greedy decoding y del presupuesto de trayectorias.
  12. 12 / CÓDIGO / VERIFICACIÓN8 SEP 2026 · arXiv v1

    ExecCritic

    Separa el rol que genera tests del rol que repara y exige que el feedback sea útil antes de aplicarlo.

    HALLAZGO OBSERVADO

    Tener tests no basta: el valor del feedback depende de la calidad del agente que los genera.

    FRONTERA

    Se genera un bundle por issue y se reutiliza. En SWE-bench Pro, un único bundle recupera poco margen frente al feedback Oracle.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Con el agente Qwen de reparación fijo, los tests del Qwen base redujeron la tasa resuelta de 61.2% a 57.3%; los de GPT-5.6-sol la elevaron a 65.3%.

      61.2→57.3%; 65.3% con test cualificado · baseline: Round-0 sin test: 61.2% · SWE-bench Verified; Qwen3.5-35B-A3B como Repair; medias de tres corridas.
    Fuente primaria ↗Próxima prueba: Introducir un gate de calidad de tests y comparar con tests humanos, tests Oracle y abstención ante tests no fiables.
  13. 13 / EVALUACIÓN / INTERFAZ8 SEP 2026 · arXiv v1

    API vs chatbot

    Comprueba si el score de API es un proxy válido del comportamiento de la interfaz conversacional.

    HALLAZGO OBSERVADO

    La interfaz real debe evaluarse como parte del sistema desplegado; el checkpoint o prompt no son detalles intercambiables.

    FRONTERA

    No se confirma que API e interfaz sirvan siempre el mismo checkpoint. Son benchmarks estandarizados, no conversaciones naturales.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. La exactitud vía API fue 3.4 puntos porcentuales mayor que vía interfaz, con SE=1.11 y p=0.002; los siete sistemas mostraron brecha significativa.

      API +3.4 pp; SE 1.11; p=0.002 · baseline: La interfaz chatbot de cada sistema · Siete sistemas; nueve benchmarks; cinco corridas por ítem; recolección marzo–mayo de 2026.
    Fuente primaria ↗Próxima prueba: Repetir con interfaces de producción, suscripciones y conversaciones naturales antes de trasladar decisiones de procurement desde API.
  14. 14 / MULTIMODAL / RAG8 SEP 2026 · arXiv v1

    Generator-aligned multimodal RAG

    Alinea el reranking con la utilidad que la evidencia aporta a la respuesta final.

    HALLAZGO OBSERVADO

    La relevancia semántica y la utilidad para el generador no son idénticas; la mejora depende de etiquetas y evaluaciones adicionales.

    FRONTERA

    La minería requiere respuestas etiquetadas. El re-mining periódico repite el coste de evaluar el VLM.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Con Qwen3-VL-4B-Instruct, la pérdida contrastiva guiada por el generador alcanzó 96.27±0.03% en VQA-X y 87.00±0.13% en A-OKVQA frente a 94.75% y 85.04% sin entrenamiento.

      96.27/87.00% frente a 94.75/85.04% · baseline: Reranker base sin entrenamiento · Dos épocas; candidate pool top-10; media±desviación estándar de tres semillas.
    Fuente primaria ↗Próxima prueba: Medir si la ganancia se conserva sin respuestas etiquetadas frecuentes y frente a retrievers que cambien de dominio.
  15. 15 / AGENTES / CONTEXTO7 SEP 2026 · arXiv v1

    Subagents vs Agent Skills

    Compara cargar skills en el contexto principal con ejecutar conocimiento reusable en subagentes.

    HALLAZGO OBSERVADO

    La ventaja depende de que el paquete procedural tenga contrato de entrada/salida y de que el coste de coordinación compense el ahorro de contexto.

    FRONTERA

    Sólo 64/87 tareas admitieron paquetes adecuados. Los subagentes consumen más tokens totales.

    ABRIR EVIDENCIA LOCALIZABLE1 claims +
    1. Con skills curadas sin contratos claros, agent-skill igualó o superó a subagents; con skills procedurales y contratos explícitos, subagents superó a agent-skill, especialmente en modelos pequeños.

      Ventaja condicional, no regla universal · baseline: Carga de skill en el contexto principal · OpenHands sobre 64 de 87 tareas de SkillsBench; paquetes derivados de trayectorias exitosas.
    Fuente primaria ↗Próxima prueba: Probar contratos explícitos en tareas del propio sistema y medir coste total, latencia, recuperación y pérdida de contexto.
04CONEXIONES / QUÉ SE PUEDE LEER JUNTOS

El mapa dice cómo leerlos juntos.

Una relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.

Physics benchmark auditsupportsevidence-before-reasoning
Auditar la evidencia antes de comparar · confianza alta

La corrección experta modifica la interpretación de resultados de benchmark; medir primero el instrumento evita razonar sobre errores del grader.

K-Benchextendsagent-evaluation-as-product
Evaluación multicanal · confianza alta

Añade leakage no paramétrico y canales de ejecución a la unidad de evaluación.

Enterprise Graph RAGqualifiesstructured-evidence-joins
Estructura y trade-offs · confianza alta

Las uniones estructuradas pueden mejorar la exactitud y empeorar otras dimensiones dentro del mismo experimento.

Distribution-Shape QPPqualifiesverification-economics
Latencia y robustez · confianza alta

La verificación barata no garantiza robustez OOD; el presupuesto debe incluir transferencia de dominio.

JarvisGUIsupportsinterface-as-model
Superficie de ejecución · confianza alta

La continuidad entre dispositivos condiciona la capacidad efectiva del agente.

ConvMemqualifiesmemory-as-retrieval-policy
Memoria y coste · confianza alta

Una política de memoria puede ganar robustez OOD a cambio de más cómputo total.

RD-Forgetsupportsmemory-as-retrieval-policy
Elegibilidad condicionada por consulta · confianza alta

Conservar historia y construir una vista answer-time es distinto de borrar indiscriminadamente.

AgentAuditqualifiesagent-evaluation-as-product
Trazas y juez · confianza alta

La evaluación full-lifecycle aporta cobertura, pero un juez único y single-trial limitan la robustez.

Era by Eonqualifiesagent-evaluation-as-product
Ground truth y cobertura · confianza alta

Un leaderboard con intervalos amplios necesita publicar cobertura de comparación, no sólo el score puntual.

Procedural Graphssupportspolicy-as-interface
Procedimiento ejecutable · confianza media

La estructura procedural funciona como una interfaz operativa dentro del protocolo comparado.

ExecCriticqualifiesruntime-traces-and-assurance
Calidad del test · confianza alta

El feedback sólo asegura si el test que lo produce es suficientemente fiable.

Subagents vs Agent Skillsqualifiessmall-specialized-agents
Contratos de especialización · confianza alta

La especialización no explica sola la ventaja; el contrato procedural y el coste de coordinación son decisivos.

COMPARACIONES DESCARTADAS8 límites de interpretación +

Enterprise Graph RAG contradice Generator-aligned multimodal RAG: rechazado; migración de código y reranking multimodal usan tareas, mecanismos y métricas distintas.

ConvMem contradice RD-Forget: rechazado; comparan memoria OOD de contexto largo y elegibilidad answer-time en benchmarks distintos.

JarvisGUI contradice API vs chatbot: rechazado; TSR cross-device y brecha API–interfaz no son niveles comparables.

ExecCritic contradice Negative Self-Distillation: rechazado; uno evalúa feedback de tests y el otro modifica entrenamiento matemático.

AgentAudit contradice Era by Eon: rechazado; juez único y cobertura estadística son limitaciones diferentes y compatibles.

Physics benchmark audit contradice K-Bench: rechazado; auditoría de benchmark y leakage multicanal son controles complementarios.

Procedural Graphs contradice Subagents vs Agent Skills: rechazado; ambos muestran efectos procedurales bajo condiciones diferentes.

QPP contradice generator-aligned multimodal RAG: rechazado; predictor de suficiencia y reranker downstream cumplen funciones distintas.

04BCONCEPTOS VIVOS

13 ideas, con el candidato separado.

Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.

EXTENSIÓN3 PAPERS

Evidence before reasoning

La evidencia debe auditarse y medirse por suficiencia antes de derivar una comparación o conceder autoridad.

Apoyo: Physics benchmark audit, Distribution-Shape QPP y multimodal RAGFalta: Falta una métrica común de suficiencia, riesgo y coste.
EXTENSIÓN3 PAPERS

Memory as retrieval policy

La memoria operativa es una vista condicionada por la consulta, no necesariamente el archivo completo ni un borrado permanente.

Apoyo: ConvMem, RD-Forget y K-BenchFalta: Faltan jueces independientes y slices de memoria beneficiosa, dañina y neutral.
EXTENSIÓN3 PAPERS

Agent evaluation as product

Un benchmark mantenible necesita estate, ground truth, instrumentación, cobertura de pares y atribución del fallo.

Apoyo: K-Bench, AgentAudit y Era by EonFalta: Falta un protocolo común de robustez del juez.
EXTENSIÓN2 PAPERS

Runtime traces and assurance

La traza y la calidad del feedback importan tanto como el resultado final.

Apoyo: AgentAudit y ExecCriticFalta: Falta replay multi-juez y una métrica interoperable.
EXTENSIÓN2 PAPERS

Interface as model

API, chatbot, dispositivo y continuidad de estado forman parte del sistema evaluado.

Apoyo: JarvisGUI y API vs chatbotFalta: Falta separar formato, permisos, modelo servido y estado.
EXTENSIÓN2 PAPERS

Policy as interface

Los procedimientos y contratos de ejecución determinan qué puede hacer un agente y cómo se valida.

Apoyo: Procedural Graphs y K-BenchFalta: Falta comprobar delegación dinámica y efectos remotos.
EXTENSIÓN2 PAPERS

Structured evidence joins

Preservar estructura y procedencia mejora ciertas tareas, pero puede aumentar complejidad o degradar otras dimensiones.

Apoyo: Enterprise Graph RAG y Era by EonFalta: El Graph RAG necesita replicación en más repositorios.
EXTENSIÓN2 PAPERS

Small specialized agents

La especialización sólo aporta cuando el procedimiento tiene contrato y el coste de coordinación está justificado.

Apoyo: ExecCritic y Subagents vs Agent SkillsFalta: Falta medir el patrón en tareas propias.
CANDIDATO2 PAPERS

Verification economics

La verificación barata puede fallar OOD; la calidad del verificador debe entrar en el presupuesto.

Apoyo: Distribution-Shape QPP y ExecCriticFalta: Sólo aparece en este corte; necesita otra semana independiente.
EXTENSIÓN2 PAPERS

Selective recovery

La respuesta adecuada a un fallo puede ser abstenerse, cambiar la vista de memoria o recalibrar el gate, no reiniciar todo.

Apoyo: QPP y RD-ForgetFalta: Falta comparar con retry ciego y replay.
CANDIDATO1 PAPERS

Downstream-utility-aligned evidence

La evidencia puede ordenarse por la utilidad que aporta a la respuesta final, no sólo por similitud semántica.

Apoyo: Generator-aligned multimodal RAGFalta: Un solo paper; falta comprobar estabilidad sin respuestas etiquetadas frecuentes.
CANDIDATO2 PAPERS

Executable procedure substrate

El conocimiento reusable gana capacidad cuando se convierte en un procedimiento invocable con contrato y criterio de salida.

Apoyo: Procedural Graphs y Subagents vs Agent SkillsFalta: Falta medir recuperación, coste de coordinación y evolución en tareas propias.
CANDIDATO1 PAPERS

Negative behavior distillation

Un agente puede aprender a evitar trayectorias defectuosas autogeneradas, pero el efecto aún está acotado al dominio evaluado.

Apoyo: Negative Self-DistillationFalta: Un solo paper y dominio matemático; falta transferencia y un gate de corrección independiente.
FRONTERA DE CONFIANZA

El corte orienta una prueba; no demuestra una adopción.

Edición provisional: 15 fuentes primarias fueron abiertas y 21 claims conservan versión, localizador, baseline, setting y limitación. Las señales scout no se usan como evidencia. La ratificación editorial final quedó en needs-review porque el editor recibió inicialmente un resumen incompleto; además, la corrida MCP no pudo crear un runId por falta de sesión activa de ChatGPT. No se afirma persistencia, replay ni publicación canónica.

SIGUIENTE PRUEBA

Ratificar el bundle y persistirlo con el mismo runKey.

Medir: 15 fuentes abiertas, 21 claims, 12 relaciones, 10 extensiones conceptuales y 3 candidatos, IDs, conteos, hashes, abstención, latencia y coste con costStatus=unknown cuando no haya telemetría.

Parar si: No elevar a published/canonical si falta runId, hay duplicados, se pierde un localizador, aparece source-pending como evidencia o se reintroduce TSBench fuera del corte.

Abrir bundle para agentes