NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 16

RECOVERY · REASONING · AGENTES

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

ImprescindibleLectura primaria completa

Reintentar no es una estrategia: primero hay que saber qué clase de fallo ocurrió.

AUTHORS / LABPan Wang, Yihao Hu, Hang Wang y colaboradores; Ant International
FECHA12 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.

EVIDENCIA DISPONIBLE

En ALFWorld, AppWorld y XBRL Finance, DARC mejora el rendimiento medio frente a los agentes base y los playbooks amplios mientras reduce pasos de entorno o presupuesto de retrieval, según la tarea.

Resultado reportado con fuente enlazada · 4 localizadores disponibles.
LÍMITE

Un diagnóstico incorrecto puede enviar el caso a una recuperación peor que un reintento simple; la taxonomía también necesita mantenimiento.

SIGUIENTE PRUEBA

Tasa de recuperación, pasos hasta resolver, precisión del diagnóstico y coste de retrieval.

EN UNA FRASE

El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.

SEÑALRecovery · Reasoning
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

En ALFWorld, AppWorld y XBRL Finance, DARC mejora el rendimiento medio frente a los agentes base y los playbooks amplios mientras reduce pasos de entorno o presupuesto de retrieval, según la tarea.

baseline: agentes base y playbooks de recuperación amplios · contexto: Tres familias de tareas con políticas de recuperación seleccionadas en desarrollo y congeladas para test

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

Diagnosis Before Recovery cuestiona una reacción habitual de los agentes: cuando algo falla, añadir más contexto y pedir otro intento. Esa estrategia puede ser contraproducente si el error no necesita más información, sino una interfaz de reparación distinta. Un fallo de acción inválida, un procedimiento ausente y un formato estricto no deberían compartir automáticamente el mismo playbook.

DARC convierte el diagnóstico en una etapa explícita del harness. A partir de fallos del conjunto de desarrollo perfila los modos de error de cada familia de tareas, elimina de una biblioteca común las intervenciones que no son admisibles y congela una política de éxito-coste seleccionada por un verificador para usarla en despliegue. La secuencia es primero decidir qué clase de reparación tiene sentido y después gastar evidencia o contexto.

El protocolo se prueba en ALFWorld, AppWorld y XBRL Finance. Según el resumen del paper, produce un harness de validez de acciones, un fallback de recuperación procedural y una política de retrieval de precisión de formato; en cada entorno mejora el rendimiento medio frente al agente base y frente a playbooks amplios, reduciendo además pasos de entorno o presupuesto de retrieval.

La lectura importante es que la autocorrección no debe medirse por cuánto texto añade, sino por si el error se vuelve accionable y la intervención adecuada llega a tiempo. El coste está en mantener la taxonomía y el verificador: un diagnóstico equivocado puede enrutar el caso a una recuperación peor. En un producto real conviene conservar el tipo de fallo, la intervención elegida y el resultado para poder revisar esa política.

DECISIÓN RÁPIDACrear una taxonomía pequeña de fallos observables y medir qué recuperación reduce tiempo, coste y repetición de errores.
NO LO SOBREINTERPRETES

Un diagnóstico incorrecto puede enviar el caso a una recuperación peor que un reintento simple; la taxonomía también necesita mantenimiento.

PROBLEMA
La reflexión genérica y el ‘inténtalo otra vez’ pueden añadir contexto irrelevante o empeorar una trayectoria cuando el fallo requiere otra corrección.
MÉTODO
Clasifica primero el tipo de fallo del agente y selecciona después una recuperación específica. Sustituye el reintento genérico por un bucle parecido al manejo de excepciones semántico.
TIPO DE EVIDENCIA
Evaluación de recuperación selectiva en tareas agentic; la aportación está en el diagnóstico y el enrutamiento, no en pedir al modelo que reflexione indefinidamente.
LÍMITE
Un diagnóstico incorrecto puede enviar el caso a una recuperación peor que un reintento simple; la taxonomía también necesita mantenimiento.
FIGURA DE LECTURA / RECOVERYFallo → diagnóstico → recuperación selectiva
Abrir paper original ↗

El sistema decide cómo reparar después de clasificar el tipo de error.

SEÑALQué dejó de funcionar
CLASEDatos, esquema, API o evidencia
RUTACorregir, reintentar o escalar
PARA RECORDAR

Medir qué recuperación reduce repetición, tiempo y coste; no solo si la tarea termina.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / Evaluación de recuperación selectiva en tareas agentic; la aportación está en el diagnóstico y el enrutamiento, no en pedir al modelo que reflexione indefinidamente.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Clasifica primero el tipo de fallo del agente y selecciona después una recuperación específica. Sustituye el reintento genérico por un bucle parecido al manejo de excepciones semántico.

QUÉ APORTA

Introduce un equivalente agentic del manejo de excepciones semántico: diagnosticar, enrutar y recuperar con una política específica.

QUÉ NO PRUEBA

Un diagnóstico incorrecto puede enviar el caso a una recuperación peor que un reintento simple; la taxonomía también necesita mantenimiento.

Cómo lo llevaría a un proyecto

Crear una taxonomía pequeña de fallos observables y medir qué recuperación reduce tiempo, coste y repetición de errores.

Coding agentsRPAAgentes financierosRobóticaWorkflows complejos

Preguntas que conviene probar

  • ¿Qué señales distinguen un error de datos de un error de herramienta?
  • ¿Cuándo debe el agente parar y pedir ayuda humana?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA100 trayectorias con cuatro clases de fallo y un conjunto holdout, comparando reintento genérico, playbook amplio y DARC.
PREGUNTA¿Diagnosticar el tipo de fallo antes de recuperar mejora la resolución y evita reintentos inútiles en errores no vistos?
MÉTRICATasa de recuperación, pasos hasta resolver, precisión del diagnóstico y coste de retrieval.
PARADAParar si DARC no mejora 10 puntos la recuperación o si las rutas mal seleccionadas superan 5%.

Mi lectura

El bucle robusto no es pensar más: es entender el tipo de error antes de intervenir.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.