NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 02

AGENTES · TOOL USE · LATENCIA

OODA-Tool: Specialized OODA Loops for Tool-Using Agents

ImprescindibleLectura primaria completa

Separar observar, orientar, decidir y actuar puede mejorar el uso de herramientas, pero cada llamada secuencial tiene un precio operativo.

AUTHORS / LABRongfeng Guo, Yinxuan Huang, Yusen Wu, Maoqing Zhong, Yunlu Chen, Meng Tang, Teng Long y colaboradores
FECHA25 AGO 2026 · v2 27 AGO
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

EVIDENCIA DISPONIBLE

Specialized OODA mejora Task Success frente a Direct-LoRA entre 4,48 y 6,99 puntos porcentuales según el tamaño del modelo.

Resultado con localizador exacto · 7 localizadores disponibles.
LÍMITE

La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.

SIGUIENTE PRUEBA

Task Success, Tool Exact, llamadas por tarea, p50/p95 y coste por tarea.

EN UNA FRASE

OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.

SEÑALespecialización por fase · tool exactness · coste secuencial
EVIDENCIAResultado con localizador exacto
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay localizadores exactos registrados.
RESULTADO REPORTADO

Specialized OODA mejora Task Success frente a Direct-LoRA entre 4,48 y 6,99 puntos porcentuales según el tamaño del modelo.

+4,48 a +6,99 pp · baseline: Direct-LoRA · contexto: Qwen3 0,6B–14B; 11.111 sesiones

RESULTADO REPORTADO

Tool Exact queda entre 98,55% y 99,42% en los tamaños evaluados.

98,55–99,42% · baseline: Comparativa del estudio · contexto: Misma evaluación de tool use

RESULTADO REPORTADO

La variante de 1,7B presenta 2,36× de latencia normalizada por las llamadas secuenciales.

2,36× · baseline: Latencia normalizada del baseline · contexto: Análisis de coste del ciclo OODA

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / El trabajo examina si un ciclo OODA explícito permite que un agente use herramientas con mayor precisión que una política LoRA directa.

MÉTODO / Cada fase del ciclo recibe una función especializada y la evaluación cubre modelos Qwen3 de 0,6B a 14B sobre 11.111 sesiones.

RESULTADO / La mejora de Task Success oscila entre +4,48 y +6,99 puntos porcentuales según el tamaño; Tool Exact se mantiene entre 98,55% y 99,42%.

LÍMITE / La secuencia añade llamadas: el caso de 1,7B registra 2,36× la latencia normalizada. La arquitectura requiere un gate de presupuesto antes de entrar en producción.

DECISIÓN RÁPIDAAplicar especialización sólo a la fase que concentra errores y mantener un modo directo para tareas sencillas; registrar llamadas, latencia y exactitud de herramienta por etapa.
NO LO SOBREINTERPRETES

La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.

PROBLEMA
Una política única tiende a mezclar observación, planificación y ejecución; esa mezcla puede ocultar dónde se pierde exactitud y cuánto cuesta cada mejora.
MÉTODO
OODA-Tool divide la interacción con herramientas en un ciclo observar–orientar–decidir–actuar y especializa los módulos que aprenden cada fase. La comparación se realiza sobre Qwen3 de 0,6B a 14B y 11.111 sesiones, frente a una adaptación LoRA directa.
TIPO DE EVIDENCIA
La fuente reporta mejoras de Task Success de 6,86, 6,79, 6,99, 5,94 y 4,48 puntos porcentuales en los tamaños evaluados, junto con Tool Exact entre 98,55% y 99,42%. El beneficio debe leerse junto con el coste secuencial.
LÍMITE
La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

OODA-Tool divide la interacción con herramientas en un ciclo observar–orientar–decidir–actuar y especializa los módulos que aprenden cada fase. La comparación se realiza sobre Qwen3 de 0,6B a 14B y 11.111 sesiones, frente a una adaptación LoRA directa.

QUÉ APORTA

La arquitectura sugiere una regla de diseño: medir el beneficio por fase junto con la latencia multiplicativa de las llamadas adicionales.

QUÉ NO PRUEBA

La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.

Cómo lo llevaría a un proyecto

Aplicar especialización sólo a la fase que concentra errores y mantener un modo directo para tareas sencillas; registrar llamadas, latencia y exactitud de herramienta por etapa.

agentes con APIsautomatización de backofficeorquestación multi-herramientaserving de modelos pequeños

Preguntas que conviene probar

  • ¿El beneficio procede de la especialización o de más cómputo secuencial?
  • ¿Qué tamaño de modelo alcanza el mejor equilibrio entre exactitud y latencia?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA100 tareas clasificadas por observación, planificación y ejecución, con variantes OODA completa, parcial y directa.
PREGUNTA¿Qué fases necesitan especialización para reducir errores sin pagar el ciclo completo?
MÉTRICATask Success, Tool Exact, llamadas por tarea, p50/p95 y coste por tarea.
PARADANo promover si la mejora no conserva al menos 98% de Tool Exact o si p95 aumenta más de 50% sin una mejora de calidad proporcional.

Mi lectura

La especialización del agente sólo es una mejora si el presupuesto de latencia y la complejidad del ciclo siguen siendo aceptables.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.