NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 02

AGENTES

Eluna: An Agentic LLM System for Automating Warehouse Operations

ImprescindibleLectura primaria completa

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos.

AUTHORS / LABNing Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi
FECHA9 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.

EVIDENCIA DISPONIBLE

Eluna-G improves 6.5% and Eluna-Q improves 6.0% over the baseline on average.

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Sistema multiagente desplegado en producción que convierte procedimientos operativos estándar en grafos dirigidos. Los agentes reciben solo la parte relevante del procedimiento, ejecutan tareas independientes en paralelo y acceden a código y datos en vivo. Usa además destilación episódica: un modelo fuerte aprende de errores y después transfiere las trayectorias corregidas a un modelo pequeño.

SEÑALlogística · industria
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Eluna-G improves 6.5% and Eluna-Q improves 6.0% over the baseline on average.

6.5% · baseline: Comparación declarada en la sección de evaluación · contexto: 5 Experiments

RESULTADO REPORTADO

The largest gains concentrate on complex multi-step tasks like Causal Chain Analysis (Task 5), Query Understanding (Task 8), and Query Decomposition (Task 10).

contexto: 5 Experiments

RESULTADO REPORTADO

Fine-tuning on complete trajectories closes the gap (Table 2 ): all trained models improve observation binary correctness by over +49%, root-cause binary correctness by over +73%, and exact match by +84% on root causes and +165% on actions, with our 32B model matching the GLM-4.7 teacher across all metrics—evidence that trajectory distillation transfers full SOP traversal behavior, not just isolated skills.

49% · contexto: 5 Experiments

RESULTADO REPORTADO

Median end-to-end execution latency (wall-clock from query to final action) is also reduced by 54.3% (Eluna-Q) and 54.8% (Eluna-G) relative to GLM-4.7, meeting the latency constraints for real-time diagnostic support.

54.3% · contexto: 5 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.

MÉTODO / La lectura de 2 Related Work describe la intervención y su construcción: LLM agents have been equipped with code execution 5 ; 25 , APIs 18 ; 20 , and standardized tool protocols 2 . Multi-step reasoning methods range from chain-of-thought 26 and tree-of-thoughts 30 to interleaved reasoning and action 31 and hierarchical decomposition 9 ; 3 . These approaches improve general reasoning but rely on loosely structured prompts without mechanisms to enforce deterministic procedural constraints. Multi-agent frameworks such as AutoGen 27 and MetaGPT 7 enable task decomposition across specialized agents. SOPStruct 6 converts unstructured SOPs into DAGs, but focuses only on structuring rather… [Fuente: https://arxiv.org/html/2607.08960#S2]

RESULTADO / La sección 5 Experiments informa: Eluna-G improves 6.5% and Eluna-Q improves 6.0% over the baseline on average. The largest gains concentrate on complex multi-step tasks like Causal Chain Analysis (Task 5), Query Understanding (Task 8), and Query Decomposition (Task 10). Fine-tuning on complete trajectories closes the gap (Table 2 ): all trained models improve observation binary correctness by over +49%, root-cause binary correctness by over +73%, and exact match by +84% on root causes and +165% on actions, with our 32B model matching the GLM-4.7 teacher across all metrics—evidence that trajectory distillation transfers full SOP traversal behavior, not just isolated skills. [Fuente: https://arxiv.org/html/2607.08960#S5]

LÍMITE / El cierre de la fuente señala: Deploying Eluna in production surfaced two lessons that generalize beyond our setting. First, within the graph-guided framework, distillation beats scale for procedural compliance: a fine-tuned 32B model matches a far larger teacher and surpasses every OTS model tested, which plateau regardless of size. Second, the operational constraint of low latency under a production SLA is what forced the asymmetric distillation design, since exposing episodic memory… La transferencia a operaciones de almacén requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.08960#S7].

DECISIÓN RÁPIDAProbar la propuesta en operaciones de almacén reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

PROBLEMA
Los SOP completos saturan el contexto y los LLM genéricos no garantizan cumplimiento procedimental.
MÉTODO
La lectura de 2 Related Work describe la intervención y su construcción: LLM agents have been equipped with code execution 5 ; 25 , APIs 18 ; 20 , and standardized tool protocols 2 . Multi-step reasoning methods range from chain-of-thought 26 and tree-of-thoughts 30 to interleaved reasoning and action 31 and hierarchical decomposition 9 ; 3 . These approaches improve general reasoning but rely on loosely structured prompts without mechanisms to enforce deterministic procedural constraints. Multi-agent frameworks such as AutoGen 27 and MetaGPT 7 enable task decomposition across specialized agents. SOPStruct 6 converts unstructured SOPs into DAGs, but focuses only on structuring rather…
TIPO DE EVIDENCIA
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.08960#S5.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Related Work describe la intervención y su construcción: LLM agents have been equipped with code execution 5 ; 25 , APIs 18 ; 20 , and standardized tool protocols 2 . Multi-step reasoning methods range from chain-of-thought 26 and tree-of-thoughts 30 to interleaved reasoning and action 31 and hierarchical decomposition 9 ; 3 . These approaches improve general reasoning but rely on loosely structured prompts without mechanisms to enforce deterministic procedural constraints. Multi-agent frameworks such as AutoGen 27 and MetaGPT 7 enable task decomposition across specialized agents. SOPStruct 6 converts unstructured SOPs into DAGs, but focuses only on structuring rather…

QUÉ APORTA

Es una de las pocas señales recientes de agentes empresariales con despliegue productivo, evaluación de tareas reales y optimización explícita de latencia y coste. Reporta un 94% de acuerdo con expertos en una aplicación de gestión de tickets.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en operaciones de almacén reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

operaciones de almacéngestión de incidenciasmantenimientosupply chain y ejecución de procedimientos.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando operaciones de almacén cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAoperaciones de almacén con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora operaciones de almacén frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si operaciones de almacén puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.