Lo esencial antes de invertir más tiempo.
OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.
Specialized OODA mejora Task Success frente a Direct-LoRA entre 4,48 y 6,99 puntos porcentuales según el tamaño del modelo.
Resultado con localizador exacto · 7 localizadores disponibles.La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.
Task Success, Tool Exact, llamadas por tarea, p50/p95 y coste por tarea.
OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.
Qué está reportado y qué conviene comprobar.
Specialized OODA mejora Task Success frente a Direct-LoRA entre 4,48 y 6,99 puntos porcentuales según el tamaño del modelo.
+4,48 a +6,99 pp · baseline: Direct-LoRA · contexto: Qwen3 0,6B–14B; 11.111 sesiones
Tool Exact queda entre 98,55% y 99,42% en los tamaños evaluados.
98,55–99,42% · baseline: Comparativa del estudio · contexto: Misma evaluación de tool use
La variante de 1,7B presenta 2,36× de latencia normalizada por las llamadas secuenciales.
2,36× · baseline: Latencia normalizada del baseline · contexto: Análisis de coste del ciclo OODA
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PREGUNTA / El trabajo examina si un ciclo OODA explícito permite que un agente use herramientas con mayor precisión que una política LoRA directa.
MÉTODO / Cada fase del ciclo recibe una función especializada y la evaluación cubre modelos Qwen3 de 0,6B a 14B sobre 11.111 sesiones.
RESULTADO / La mejora de Task Success oscila entre +4,48 y +6,99 puntos porcentuales según el tamaño; Tool Exact se mantiene entre 98,55% y 99,42%.
LÍMITE / La secuencia añade llamadas: el caso de 1,7B registra 2,36× la latencia normalizada. La arquitectura requiere un gate de presupuesto antes de entrar en producción.
La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.
- PROBLEMA
- Una política única tiende a mezclar observación, planificación y ejecución; esa mezcla puede ocultar dónde se pierde exactitud y cuánto cuesta cada mejora.
- MÉTODO
- OODA-Tool divide la interacción con herramientas en un ciclo observar–orientar–decidir–actuar y especializa los módulos que aprenden cada fase. La comparación se realiza sobre Qwen3 de 0,6B a 14B y 11.111 sesiones, frente a una adaptación LoRA directa.
- TIPO DE EVIDENCIA
- La fuente reporta mejoras de Task Success de 6,86, 6,79, 6,99, 5,94 y 4,48 puntos porcentuales en los tamaños evaluados, junto con Tool Exact entre 98,55% y 99,42%. El beneficio debe leerse junto con el coste secuencial.
- LÍMITE
- La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
OODA-Tool divide la interacción con herramientas en un ciclo observar–orientar–decidir–actuar y especializa los módulos que aprenden cada fase. La comparación se realiza sobre Qwen3 de 0,6B a 14B y 11.111 sesiones, frente a una adaptación LoRA directa.
La arquitectura sugiere una regla de diseño: medir el beneficio por fase junto con la latencia multiplicativa de las llamadas adicionales.
La arquitectura añade llamadas y el agente de 1,7B llega a 2,36 veces la latencia normalizada. No debe extrapolarse una mejora de calidad a un workflow de baja latencia sin repetir el presupuesto completo.
Cómo lo llevaría a un proyecto
Aplicar especialización sólo a la fase que concentra errores y mantener un modo directo para tareas sencillas; registrar llamadas, latencia y exactitud de herramienta por etapa.
Preguntas que conviene probar
- ¿El beneficio procede de la especialización o de más cómputo secuencial?
- ¿Qué tamaño de modelo alcanza el mejor equilibrio entre exactitud y latencia?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La especialización del agente sólo es una mejora si el presupuesto de latencia y la complejidad del ciclo siguen siendo aceptables.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.