# FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s
- Fuente primaria: https://arxiv.org/abs/2606.14119
- Versión leída: v1
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman
- Fecha del corte: 12 JUNIO 2026; IEEE INDIN 2026.
- Área: RAG · EVALUACIÓN · SEGURIDAD

## Tesis y contexto

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.

- Problema: En fábrica, la información crítica está repartida entre manuales, máquinas, software y procesos. RAG genérico no basta si no se evalúa por groundedness, trazabilidad y seguridad local.
- Por qué importa: Es muy aplicable a mantenimiento, diagnóstico, operaciones y digitalización industrial. Para pymes industriales puede ser una plantilla de producto.

## Evidencia reportada

- **reported-result**: All models achieve overall averages between 0.73 and 0.76, confirming that RAG-based cross-machine reasoning is feasible within FactoryLLM. [localizador](https://arxiv.org/html/2606.14119#S5)
- **reported-result**: Context recall is substantially higher (0.76–0.89), meaning relevant information is present but diluted by noise (Fig. [localizador](https://arxiv.org/html/2606.14119#S5)
- **reported-result**: Two findings emerge: (1) cross-machine RAG is feasible but retrieval-limited — groundedness exceeds 0.88 while precision averages 0.48; (2) RAGAS and NVIDIA metrics provide complementary signals at different strictness levels ( r=0.61 between recall and faithfulness; groundedness averages 0.91 vs. [localizador](https://arxiv.org/html/2606.14119#S5)

## Lectura y límite

- Método: La lectura de Related Work describe la intervención y su construcción: In this section, we explore the current modern efforts on the use of LLMs for improved reasoning and understanding of manufacturing workflows. A. LLMs in Manufacturing. The use of Large language models in manufacturing is growing rapidly. Li et al. [ 7 ] provide a thorough survey of how LLMs are used in production planning, quality assurance, and maintenance; pointing out that, although LLMs appear to be very good at understanding unstructured data from manufacturing, issues of domain adaptation and dealing with varied data from many different industrial machines still exist. Raza et al. [ 11 ] review industrial…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Results and Evaluation.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: This paper introduces FactoryLLM, a safe and open LLM playground for evaluating the reasoning abilities of RAG-based LLMs when dealing with documentation from multiple interconnected industrial machines. FactoryLLM ensures safety by supporting local and open-source LLMs, allowing experimentation without exposing sensitive industrial data, and provides a controlled environment for systematic evaluation. The Playground is open and publicly available,…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Results and Evaluation.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.14119): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.14119): tipo abstract
- [Método · Related Work](https://arxiv.org/html/2606.14119#S2): tipo section
- [Evaluación · Results and Evaluation](https://arxiv.org/html/2606.14119#S5): tipo section
- [Cierre · Conclusion](https://arxiv.org/html/2606.14119#S6): tipo section

## Próxima prueba

- ¿La propuesta mejora asistentes de mantenimiento frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [SAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/sag)
- [RAG-Stack](https://luiseduardodemiguel.com/research-ia/markdown/papers/rag-stack)
- [TTT-Embed](https://luiseduardodemiguel.com/research-ia/markdown/papers/ttt-embed)