Leer, comprobar, abstenerse.
Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.
Quince trabajos desplazan la unidad de calidad: no basta con medir el modelo. Hay que auditar el benchmark, observar todos los canales de ejecución, comprobar la interfaz real y decidir cuándo recuperar o abstenerse.
¿Qué cambia cuando la evaluación incluye benchmark, memoria, retrieval, interfaz, trazas, tests y coste como partes del mismo sistema?
Judge/Retrieve/Abstain, DentAgent, SemaPLC y SkillEffect sitúan la evidencia antes de aceptar una conclusión o conceder autoridad de ejecución.
D²ACCI y Working Set muestran cuándo conservar hechos ayuda; MemTrapBench muestra cuándo una memoria aparentemente relevante fija errores o autoridad caducada.
MUSE, D²ACCI y Self-Evolution Audit hacen visible la distancia entre lo que el agente dijo, lo que el runtime ejecutó y lo que otro agente puede recuperar.
Policy Algebra y SemaPLC muestran el coste de verificar; Task-CoEvolve propone asignar más evaluación donde todavía discrimina entre harnesses.
La lista ya no repite un resumen y un catálogo separados. Abre los claims sólo cuando quieras comprobar el localizador exacto.
Audita si un benchmark está midiendo errores del modelo o errores del propio instrumento.
La auditoría cambia el score y atribuye 148/152 fallos revisados al benchmark o al grader.
Los conjuntos post-audit no son idénticos a los conjuntos originales. La muestra parte principalmente de fallos aparentes y no estima todos los errores.
Tras validación y reparación experta, GPT-5.6-Sol pasó de 47.28% a 78.66% mean@4 en HLE-Physics y de 61.00% a 87.24% en CMT-Benchmark.
47.28→78.66%; 61.00→87.24% · baseline: Evaluación pre-audit · Tres modelos; HLE: 202 preguntas originales y 116 retenidas; CMT: 50 originales y 49 retenidas; cuatro intentos.En tres audit sets públicos, 148 de 152 casos auditados se atribuyeron a errores del benchmark o del grader y 4 a errores del modelo.
97.37% benchmark/grader; 2.63% modelo · baseline: Casos inicialmente marcados como incorrectos · Subconjuntos condicionados a fallos aparentes de cuatro intentos.Comprueba si el olvido medido en pesos cubre también prompt, retrieval, herramientas y trazas.
Los canales no paramétricos pueden filtrar secretos aunque el probe de pesos indique olvido.
El corpus principal usa PII sintética. Los sustratos se evalúan por separado y el scaffold no representa todas las arquitecturas.
Con secretos en contexto o retrieval, los probes de pesos quedaron cerca de no-memorización, pero Llama-3.1-8B expuso 22.3% en contexto, 60.2% en R-text y 85.5% en R-struct; Qwen3.5-9B llegó a 99.2% en contexto.
22.3–99.2% según canal y modelo · baseline: TOFU, MUSE, WMDP y LUME como probes paramétricos · Llama-3.1-8B, Qwen3.5-9B y Mistral-7B; seis canales observables.En ocho modelos servidos por API, el observador detectó fugas en las 24 combinaciones modelo/sustrato: OR(all) fue 0.270–1.000 en contexto, 0.160–0.710 en R-text y 0.335–0.965 en R-struct.
24/24 combinaciones con fuga observada · baseline: Sin intervención; probes directos no aplicables a endpoints · Ocho endpoints, tres sustratos no paramétricos y 200 consultas por celda.Mide si preservar estructura del repositorio mejora la migración más allá de la similitud vectorial.
La estructura reduce alucinación de API, pero introduce un coste medible en complejidad y docstrings.
Sólo se estudia un repositorio Java→Python. No hay evidencia estadística de generalización a otras familias de generación.
Graph RAG redujo la alucinación media de API de 56.4% a 16.2% y elevó la calidad ponderada de migración de 65.5% a 83.2%; CodeBLEU cambió de 90.6% a 91.1%.
56.4→16.2%; 65.5→83.2%; CodeBLEU 90.6→91.1% · baseline: Standard RAG con chunks de 800, overlap 150 y top-5 cosine retrieval · spring-petclinic-genai; Java→Python; Gemini-2.5-pro; temperatura 0; hasta tres hops AST.Graph RAG redujo Cyclomatic Complexity Consistency de 71.6% a 46.7% y Docstring Preservation de 67.0% a 61.0%.
CCC 71.6→46.7%; DP 67.0→61.0% · baseline: Standard RAG en el mismo modelo y repositorio · Misma migración Java→Python, evaluación agregada por archivos.Explora si el modelo puede mejorar alejándose de fallos autogenerados sin soluciones gold.
El método mejora Qwen3 en matemáticas dentro del protocolo descrito, pero no prueba transferencia fuera de ese dominio.
Sólo se evalúa Qwen3. El mejor checkpoint se selecciona dentro de dos épocas y sobre tareas matemáticas.
NSD mejoró Avg@8 frente al modelo base en +2.3, +7.5 y +6.0 puntos para Qwen3 de 1.7B, 4B y 8B; los IC95% permanecen positivos.
+2.3/+7.5/+6.0 puntos · baseline: Qwen3 sin entrenamiento adicional · MATH; siete benchmarks matemáticos; dos épocas; modo non-thinking; ocho muestras por problema.En Qwen3-4B, NSD produjo 7.5 tokens de reflexión por respuesta frente a 3.6 del baseline, 2.2 con OPSD y 0.8 con Intuitor.
7.5 frente a 3.6 tokens · baseline: Modelo base y métodos comparadores · AIME 2024, AIME 2025 y HMMT 2025.Predice si el retrieval es suficiente usando la forma de sus scores antes de invocar otro juez LLM.
Una puerta de 2 ms compite con un juez LLM, pero pierde AUROC fuera de distribución.
Se usa un retriever y un juez local. Falta validación con tráfico real y la variante robusta sacrifica AUROC in-domain.
GeneralQPP/S1 alcanzó AUROC ponderado 0.856 en ViDoRe frente a 0.835 de Classic Full y 0.649 del juez Qwen3.5; su latencia fue 2.0 ms frente a 6.3 s.
0.856 AUROC; 2.0 ms/query · baseline: Classic Full y juez local Qwen3.5-35B · 14,514 consultas, ocho dominios ViDoRe, split 80/20 y cinco semillas.En leave-one-domain-out, S1 cayó de 0.856 a 0.706 AUROC; S1-Lean recuperó hasta 0.719 y superó al baseline clásico en 0.032.
0.856→0.706; S1-Lean 0.719 · baseline: S1 completo y Classic Full en transferencia OOD · ViDoRe LODO; S1-Lean con 13 features.Expone el coste de transferir estado y dependencias entre dispositivos en tareas largas.
La dependencia cross-device reduce TSR a 0–2% en el benchmark.
Sólo modelos open-source y una arquitectura planner–grounder. El benchmark requiere entornos virtualizados específicos.
En tareas multi-device con dependencias, los seis agentes obtuvieron TSR entre 0% y 2%; el mejor resultado fue 2%.
0–2% TSR · baseline: Tareas atómicas y cross-platform independientes · 150 tareas: 50 single-platform dependientes, 50 cross-platform independientes y 50 cross-platform dependientes; Android, Windows y Ubuntu.Usa una memoria jerárquica y paralela para agregar contexto largo sin una cadena secuencial completa.
Mejora el resultado OOD en el protocolo evaluado, pero paga más cómputo total y depende de descomponer bien la consulta.
El conjunto OOD es sintético y contiene un error de etiqueta documentado. La tabla principal no cuantifica de forma completa el coste total ni el error de descomposición.
ConvMem superó a MemAgent en F1 en las seis longitudes de 28k–896k del benchmark OOD RULER-2WikiMultiHopQA.
72.30–59.06 frente a 60.92–58.41 · baseline: MemAgent entrenado con RL · RULER-HotpotQA como entrenamiento; 2WikiMultiHopQA sintético como OOD; 28k–896k tokens.Separa lo que se conserva en el archivo de lo que queda elegible para una respuesta concreta.
La vista de memoria condicionada por consulta supera las ablaciones y los baselines en 12 combinaciones.
Dos benchmarks usan jueces del mismo modelo o familia. Las ablaciones cambian configuraciones completas y no aíslan un único mecanismo.
RD-Forget obtuvo la mayor exactitud en las 12 combinaciones de cuatro modelos por tres benchmarks.
12/12 combinaciones; medias 66.59%, 86.71%, 77.13% y 72.83% · baseline: ACE y ReasoningBank · 264 tareas por método: 86 AMB-Text, 78 LME-KU y 100 MAB-FC; cuatro backbones.Eliminar FORGET o esconder la pregunta al curador produce caídas grandes en los tres benchmarks de Luna.
Full 91.86/93.59/74.00 → sin FORGET 68.60/60.26/51.00 · baseline: Configuración matched Full · GPT-5.6-Luna; 264 tareas emparejadas entre configuración completa y ablaciones.Evalúa planificación, memoria, herramientas, grounding y ataques como una trayectoria completa.
La traza completa distingue tipos de fallo, pero el ranking queda limitado por juez único y una sola prueba por celda.
Una prueba por modelo-tarea. El juez fijo también es uno de los modelos evaluados y los pesos del score no están calibrados empíricamente.
Claude Sonnet 5 obtuvo CTS medio 95.1 y GPT-5 80.6; los otros modelos quedaron entre 57.6 y 22.6.
CTS 95.1 frente a 80.6 y 57.6–22.6 · baseline: Comparación entre cinco modelos · 5 modelos × 9 tareas = 45 ejecuciones; seis entornos; 10 métricas agregadas.Construye un estate empresarial sintético con ground truth exacto para comparar agentes sin datos de clientes.
El benchmark permite grading determinista, pero la mayoría de las diferencias puntuales del leaderboard no están respaldadas por evidencia suficiente.
Una empresa sintética y 33 formas de pregunta. Los intervalos son amplios y no cubren todas las configuraciones descritas.
Las exactitudes estimadas abarcaron 42.4%–76.8%, pero sólo 3 de 36 comparaciones por pares aportaron evidencia suficiente para afirmar superioridad.
42.4–76.8%; 3/36 pares respaldados · baseline: gpt-5.4-mini 42.4% [27.3,58.6]; claude-opus-4.8 76.8% [61.6,90.9] · 9 modelos; 33 preguntas; 3 repeticiones; 891 respuestas; estate sintético con Gong, Salesforce y Zendesk.Representa procedimientos reutilizables como grafos editables que guían la ejecución y pueden evolucionar.
La representación procedural gana dentro del protocolo comparado, sin demostrar superioridad universal en arquitecturas heterogéneas.
Solver, guidance y refiner comparten LLM y la decodificación es greedy. El paper no presenta una sección explícita de limitaciones.
Procedural Graph quedó primero o empatado primero en 21/24 combinaciones modelo–benchmark; registró 19 victorias, 2 empates y 3 derrotas frente al mejor baseline, p=4.3×10⁻⁴.
21/24; 19–2–3; p=4.3×10⁻⁴ · baseline: Mejor baseline de cada combinación entre siete métodos · Seis benchmarks × cuatro LLM; mismo solver ReAct; temperatura 0.Separa el rol que genera tests del rol que repara y exige que el feedback sea útil antes de aplicarlo.
Tener tests no basta: el valor del feedback depende de la calidad del agente que los genera.
Se genera un bundle por issue y se reutiliza. En SWE-bench Pro, un único bundle recupera poco margen frente al feedback Oracle.
Con el agente Qwen de reparación fijo, los tests del Qwen base redujeron la tasa resuelta de 61.2% a 57.3%; los de GPT-5.6-sol la elevaron a 65.3%.
61.2→57.3%; 65.3% con test cualificado · baseline: Round-0 sin test: 61.2% · SWE-bench Verified; Qwen3.5-35B-A3B como Repair; medias de tres corridas.Comprueba si el score de API es un proxy válido del comportamiento de la interfaz conversacional.
La interfaz real debe evaluarse como parte del sistema desplegado; el checkpoint o prompt no son detalles intercambiables.
No se confirma que API e interfaz sirvan siempre el mismo checkpoint. Son benchmarks estandarizados, no conversaciones naturales.
La exactitud vía API fue 3.4 puntos porcentuales mayor que vía interfaz, con SE=1.11 y p=0.002; los siete sistemas mostraron brecha significativa.
API +3.4 pp; SE 1.11; p=0.002 · baseline: La interfaz chatbot de cada sistema · Siete sistemas; nueve benchmarks; cinco corridas por ítem; recolección marzo–mayo de 2026.Alinea el reranking con la utilidad que la evidencia aporta a la respuesta final.
La relevancia semántica y la utilidad para el generador no son idénticas; la mejora depende de etiquetas y evaluaciones adicionales.
La minería requiere respuestas etiquetadas. El re-mining periódico repite el coste de evaluar el VLM.
Con Qwen3-VL-4B-Instruct, la pérdida contrastiva guiada por el generador alcanzó 96.27±0.03% en VQA-X y 87.00±0.13% en A-OKVQA frente a 94.75% y 85.04% sin entrenamiento.
96.27/87.00% frente a 94.75/85.04% · baseline: Reranker base sin entrenamiento · Dos épocas; candidate pool top-10; media±desviación estándar de tres semillas.Compara cargar skills en el contexto principal con ejecutar conocimiento reusable en subagentes.
La ventaja depende de que el paquete procedural tenga contrato de entrada/salida y de que el coste de coordinación compense el ahorro de contexto.
Sólo 64/87 tareas admitieron paquetes adecuados. Los subagentes consumen más tokens totales.
Con skills curadas sin contratos claros, agent-skill igualó o superó a subagents; con skills procedurales y contratos explícitos, subagents superó a agent-skill, especialmente en modelos pequeños.
Ventaja condicional, no regla universal · baseline: Carga de skill en el contexto principal · OpenHands sobre 64 de 87 tareas de SkillsBench; paquetes derivados de trayectorias exitosas.Una relación sólo entra si comparte un eje verificable. Los nombres enlazan con la ficha cuando existe.
La corrección experta modifica la interpretación de resultados de benchmark; medir primero el instrumento evita razonar sobre errores del grader.
Añade leakage no paramétrico y canales de ejecución a la unidad de evaluación.
Las uniones estructuradas pueden mejorar la exactitud y empeorar otras dimensiones dentro del mismo experimento.
La verificación barata no garantiza robustez OOD; el presupuesto debe incluir transferencia de dominio.
La continuidad entre dispositivos condiciona la capacidad efectiva del agente.
Una política de memoria puede ganar robustez OOD a cambio de más cómputo total.
Conservar historia y construir una vista answer-time es distinto de borrar indiscriminadamente.
La evaluación full-lifecycle aporta cobertura, pero un juez único y single-trial limitan la robustez.
Un leaderboard con intervalos amplios necesita publicar cobertura de comparación, no sólo el score puntual.
La estructura procedural funciona como una interfaz operativa dentro del protocolo comparado.
El feedback sólo asegura si el test que lo produce es suficientemente fiable.
La especialización no explica sola la ventaja; el contrato procedural y el coste de coordinación son decisivos.
Enterprise Graph RAG contradice Generator-aligned multimodal RAG: rechazado; migración de código y reranking multimodal usan tareas, mecanismos y métricas distintas.
ConvMem contradice RD-Forget: rechazado; comparan memoria OOD de contexto largo y elegibilidad answer-time en benchmarks distintos.
JarvisGUI contradice API vs chatbot: rechazado; TSR cross-device y brecha API–interfaz no son niveles comparables.
ExecCritic contradice Negative Self-Distillation: rechazado; uno evalúa feedback de tests y el otro modifica entrenamiento matemático.
AgentAudit contradice Era by Eon: rechazado; juez único y cobertura estadística son limitaciones diferentes y compatibles.
Physics benchmark audit contradice K-Bench: rechazado; auditoría de benchmark y leakage multicanal son controles complementarios.
Procedural Graphs contradice Subagents vs Agent Skills: rechazado; ambos muestran efectos procedurales bajo condiciones diferentes.
QPP contradice generator-aligned multimodal RAG: rechazado; predictor de suficiencia y reranker downstream cumplen funciones distintas.
Las extensiones y tensiones quedan distinguidas de lo que todavía necesita otro corte.
La evidencia debe auditarse y medirse por suficiencia antes de derivar una comparación o conceder autoridad.
Apoyo: Physics benchmark audit, Distribution-Shape QPP y multimodal RAGFalta: Falta una métrica común de suficiencia, riesgo y coste.La memoria operativa es una vista condicionada por la consulta, no necesariamente el archivo completo ni un borrado permanente.
Apoyo: ConvMem, RD-Forget y K-BenchFalta: Faltan jueces independientes y slices de memoria beneficiosa, dañina y neutral.Un benchmark mantenible necesita estate, ground truth, instrumentación, cobertura de pares y atribución del fallo.
Apoyo: K-Bench, AgentAudit y Era by EonFalta: Falta un protocolo común de robustez del juez.La traza y la calidad del feedback importan tanto como el resultado final.
Apoyo: AgentAudit y ExecCriticFalta: Falta replay multi-juez y una métrica interoperable.API, chatbot, dispositivo y continuidad de estado forman parte del sistema evaluado.
Apoyo: JarvisGUI y API vs chatbotFalta: Falta separar formato, permisos, modelo servido y estado.Los procedimientos y contratos de ejecución determinan qué puede hacer un agente y cómo se valida.
Apoyo: Procedural Graphs y K-BenchFalta: Falta comprobar delegación dinámica y efectos remotos.Preservar estructura y procedencia mejora ciertas tareas, pero puede aumentar complejidad o degradar otras dimensiones.
Apoyo: Enterprise Graph RAG y Era by EonFalta: El Graph RAG necesita replicación en más repositorios.La especialización sólo aporta cuando el procedimiento tiene contrato y el coste de coordinación está justificado.
Apoyo: ExecCritic y Subagents vs Agent SkillsFalta: Falta medir el patrón en tareas propias.La verificación barata puede fallar OOD; la calidad del verificador debe entrar en el presupuesto.
Apoyo: Distribution-Shape QPP y ExecCriticFalta: Sólo aparece en este corte; necesita otra semana independiente.La respuesta adecuada a un fallo puede ser abstenerse, cambiar la vista de memoria o recalibrar el gate, no reiniciar todo.
Apoyo: QPP y RD-ForgetFalta: Falta comparar con retry ciego y replay.La evidencia puede ordenarse por la utilidad que aporta a la respuesta final, no sólo por similitud semántica.
Apoyo: Generator-aligned multimodal RAGFalta: Un solo paper; falta comprobar estabilidad sin respuestas etiquetadas frecuentes.El conocimiento reusable gana capacidad cuando se convierte en un procedimiento invocable con contrato y criterio de salida.
Apoyo: Procedural Graphs y Subagents vs Agent SkillsFalta: Falta medir recuperación, coste de coordinación y evolución en tareas propias.Un agente puede aprender a evitar trayectorias defectuosas autogeneradas, pero el efecto aún está acotado al dominio evaluado.
Apoyo: Negative Self-DistillationFalta: Un solo paper y dominio matemático; falta transferencia y un gate de corrección independiente.Edición provisional: 15 fuentes primarias fueron abiertas y 21 claims conservan versión, localizador, baseline, setting y limitación. Las señales scout no se usan como evidencia. La ratificación editorial final quedó en needs-review porque el editor recibió inicialmente un resumen incompleto; además, la corrida MCP no pudo crear un runId por falta de sesión activa de ChatGPT. No se afirma persistencia, replay ni publicación canónica.
Medir: 15 fuentes abiertas, 21 claims, 12 relaciones, 10 extensiones conceptuales y 3 candidatos, IDs, conteos, hashes, abstención, latencia y coste con costStatus=unknown cuando no haya telemetría.
Parar si: No elevar a published/canonical si falta runId, hay duplicados, se pierde un localizador, aparece source-pending como evidencia o se reintroduce TSBench fuera del corte.
Abrir bundle para agentes ↗