# ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/oragentbench-can-llm-agents-solve-challenging-operations-research-tasks
- Fuente primaria: https://arxiv.org/abs/2606.19787
- Versión leída: v1
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Jiajun Li, Mingshu Cai, Yixuan Li, Yu Ding, Ran Hou, Guanyu Nie, Xiongwei Han, Wanyuan Wang
- Fecha del corte: 18 JUNIO 2026.
- Área: AGENTES · RAG · EVALUACIÓN

## Tesis y contexto

Benchmark ejecutable para evaluar agentes en tareas reales de investigación operativa: briefs en lenguaje natural, datos multiarchivo, configuraciones y un esquema de entrega validable.

- Problema: Los benchmarks OR suelen separar modelado y resolución; aquí se mide el flujo completo.
- Por qué importa: Acerca la evaluación de agentes a planificación, logística, asignación de recursos y optimización empresarial.

## Evidencia reportada

- **reported-result**: RQ4 : Can OR-specific skills improve end-to-end OR-agent performance? [localizador](https://arxiv.org/html/2606.19787#S4)
- **reported-result**: Moreover, feasibility is consistently higher than pass rate, showing that agents often produce valid submissions without reaching sufficient optimization quality. [localizador](https://arxiv.org/html/2606.19787#S4)
- **reported-result**: Figure 4 examines how pass rates change as the quality threshold increases. [localizador](https://arxiv.org/html/2606.19787#S4)
- **reported-result**: Agents whose curves drop sharply mainly produce solutions that barely satisfy the default criterion, whereas stronger agents decline more gradually and retain nontrivial pass rates at higher quality levels. [localizador](https://arxiv.org/html/2606.19787#S4)

## Lectura y límite

- Método: La lectura de 2 Related Work describe la intervención y su construcción: LLMs for optimization modeling have progressed from equation generation toward executable modeling workflows. Prior work improves formulation and solver-code generation through domain training and synthetic data ( Huang et al. 2024a ; Lu et al. 2025 ) , and extends modeling into iterative execution, repair, debugging, and coding-agent workflows ( AhmadiTeshnizi et al. 2024 ; Zhang et al. 2025 ; Song et al. 2026 ) . However, these works mainly test whether models can produce plausible formulations or solver code, rather than whether agents can choose abstractions and formulations that are strong and effective.…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: Across these examples, the dominant bottleneck shifts from schema fidelity to evaluator-aligned objectives, formulation and fallback discipline, and finally state continuity. Reliable OR agents must therefore integrate interpretation, optimization, serialization, and independent validation into one workflow.
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.19787): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.19787): tipo abstract
- [Método · 2 Related Work](https://arxiv.org/html/2606.19787#S2): tipo section
- [Evaluación · 4 Experiments](https://arxiv.org/html/2606.19787#S4): tipo section
- [Cierre · 5 Conclusion](https://arxiv.org/html/2606.19787#S5): tipo section

## Próxima prueba

- ¿La propuesta mejora supply chain frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [ORAgentBench](https://github.com/ORAgentBench/ORAgentBench)
- [https://huggingface.co/moonshotai/Kimi-K2.6](https://huggingface.co/moonshotai/Kimi-K2.6)
- [https://openai.com/index/introducing-gpt-5-3-codex/](https://openai.com/index/introducing-gpt-5-3-codex/)
- [https://huggingface.co/XiaomiMiMo/MiMo-V2.5](https://huggingface.co/XiaomiMiMo/MiMo-V2.5)

## Enlaces relacionados

- [VAKRA](https://luiseduardodemiguel.com/research-ia/markdown/papers/vakra)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)