# Eluna: An Agentic LLM System for Automating Warehouse Operations
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/eluna-an-agentic-llm-system-for-automating-warehouse-operations
- Fuente primaria: https://arxiv.org/html/2607.08960v1
- Versión leída: v1
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi
- Fecha del corte: 9 JULIO 2026.
- Área: AGENTES

## Tesis y contexto

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.

- Problema: Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.
- Por qué importa: Es una de las pocas señales recientes de agentes empresariales con despliegue productivo, evaluación de tareas reales y optimización explícita de latencia y coste. Reporta un 94% de acuerdo con expertos en una aplicación de gestión de tickets.

## Evidencia reportada

- **reported-result**: Eluna-G improves 6.5% and Eluna-Q improves 6.0% over the baseline on average. [localizador](https://arxiv.org/html/2607.08960#S5)
- **reported-result**: The largest gains concentrate on complex multi-step tasks like Causal Chain Analysis (Task 5), Query Understanding (Task 8), and Query Decomposition (Task 10). [localizador](https://arxiv.org/html/2607.08960#S5)
- **reported-result**: Fine-tuning on complete trajectories closes the gap (Table 2 ): all trained models improve observation binary correctness by over +49%, root-cause binary correctness by over +73%, and exact match by +84% on root causes and +165% on actions, with our 32B model matching the GLM-4.7 teacher across all metrics—evidence that trajectory distillation transfers full SOP traversal behavior, not just isolated skills. [localizador](https://arxiv.org/html/2607.08960#S5)
- **reported-result**: Median end-to-end execution latency (wall-clock from query to final action) is also reduced by 54.3% (Eluna-Q) and 54.8% (Eluna-G) relative to GLM-4.7, meeting the latency constraints for real-time diagnostic support. [localizador](https://arxiv.org/html/2607.08960#S5)

## Lectura y límite

- Método: La lectura de 2 Related Work describe la intervención y su construcción: LLM agents have been equipped with code execution 5 ; 25 , APIs 18 ; 20 , and standardized tool protocols 2 . Multi-step reasoning methods range from chain-of-thought 26 and tree-of-thoughts 30 to interleaved reasoning and action 31 and hierarchical decomposition 9 ; 3 . These approaches improve general reasoning but rely on loosely structured prompts without mechanisms to enforce deterministic procedural constraints. Multi-agent frameworks such as AutoGen 27 and MetaGPT 7 enable task decomposition across specialized agents. SOPStruct 6 converts unstructured SOPs into DAGs, but focuses only on structuring rather…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: Deploying Eluna in production surfaced two lessons that generalize beyond our setting. First, within the graph-guided framework, distillation beats scale for procedural compliance: a fine-tuned 32B model matches a far larger teacher and surpasses every OTS model tested, which plateau regardless of size. Second, the operational constraint of low latency under a production SLA is what forced the asymmetric distillation design, since exposing episodic memory…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/html/2607.08960v1): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2607.08960): tipo abstract
- [Método · 2 Related Work](https://arxiv.org/html/2607.08960#S2): tipo section
- [Evaluación · 5 Experiments](https://arxiv.org/html/2607.08960#S5): tipo section
- [Cierre · 7 Conclusion](https://arxiv.org/html/2607.08960#S7): tipo section
- [HTML · fuente navegable](https://arxiv.org/abs/2607.08960v1): tipo abstract

## Próxima prueba

- ¿La propuesta mejora operaciones de almacén frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://github.com/strands-agents/harness-sdk](https://github.com/strands-agents/harness-sdk)
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [VAKRA](https://luiseduardodemiguel.com/research-ia/markdown/papers/vakra)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)