# TOPAS: Topology-Aware Scheduling for LLM Agent Workflows
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/topas
- Fuente primaria: https://arxiv.org/abs/2608.25523
- Versión leída: arXiv v1 · 26 agosto 2026
- Fuente comprobada: 2026-08-31 · lectura primaria completa; HTML primario verificado
- Autores: Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan
- Fecha del corte: 26 AGO 2026 · v1
- Área: AGENTES · SERVING · SISTEMAS

## Tesis y contexto

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

- Problema: Servir cada llamada de un workflow como una petición independiente ignora dependencias, colas y oportunidades de agrupar etapas compatibles.
- Por qué importa: Muestra que la optimización del agente no termina en el prompt o el modelo: el scheduler puede cambiar el coste temporal de la misma política.

## Evidencia reportada

- **reported-result**: TOPAS reduce mean y p99 JCT hasta 39,8% y 49,4% en los DAG sintéticos evaluados. [localizador](https://arxiv.org/html/2608.25523v1#S5.SS1)
- **reported-result**: En MetaGPT-TL, TOPAS reporta reducciones de 22,0% en mean JCT y 26,6% en p99; MetaGPT-SOP reporta 9,8% en mean. [localizador](https://arxiv.org/html/2608.25523v1#S5.SS2)
- **reported-result**: El overhead de decisión de TOPAS es 1,9 ms y 0,31% del wall time en la evaluación reportada. [localizador](https://arxiv.org/html/2608.25523v1#S5.SS3)

## Lectura y límite

- Método: TOPAS modela cada workflow de agente como un DAG y usa la topología para tomar decisiones de scheduling. La evaluación corre con SGLang v0.5.3, Qwen2.5-32B-Instruct y una NVIDIA A100 de 80GB sobre tres DAG sintéticos y dos workflows MetaGPT.
- Límite: Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
- Confianza editorial: Alta
- Limitación: La evaluación usa una GPU, un servidor y cinco familias de workflow.
- Limitación: La reducción de JCT no se traduce automáticamente en coste monetario, throughput o calidad de tarea.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.25523): tipo abstract
- [Fuente primaria · resumen](https://arxiv.org/html/2608.25523v1): tipo abstract
- [Diseño de TOPAS · §4](https://arxiv.org/html/2608.25523v1#S4): tipo section
- [Evaluación · §5](https://arxiv.org/html/2608.25523v1#S5): tipo section
- [DAG sintéticos · §5.1](https://arxiv.org/html/2608.25523v1#S5.SS1): tipo section
- [MetaGPT · §5.2](https://arxiv.org/html/2608.25523v1#S5.SS2): tipo section
- [Overhead · §5.3](https://arxiv.org/html/2608.25523v1#S5.SS3): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.25523): tipo abstract

## Próxima prueba

- ¿La planificación por topología mantiene la ganancia bajo concurrencia y fallos?
- Métrica: Mean/p99 JCT, throughput, reintentos duplicados, coste por job y completitud.
- Regla de parada: Parar si la ganancia desaparece con carga real o si el scheduler aumenta duplicados o pérdida de estado.

## Recursos reproducibles
- [HTML · fuente primaria v1](https://arxiv.org/html/2608.25523v1)

## Enlaces relacionados

- [OODA-Tool](https://luiseduardodemiguel.com/research-ia/markdown/papers/ooda-tool)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [RepoOMP](https://luiseduardodemiguel.com/research-ia/markdown/papers/repoomp)