Lo esencial antes de invertir más tiempo.
TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
TOPAS reduce mean y p99 JCT hasta 39,8% y 49,4% en los DAG sintéticos evaluados.
Resultado reportado con fuente enlazada · 8 localizadores disponibles.Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
Mean/p99 JCT, throughput, reintentos duplicados, coste por job y completitud.
TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
Qué está reportado y qué conviene comprobar.
TOPAS reduce mean y p99 JCT hasta 39,8% y 49,4% en los DAG sintéticos evaluados.
−39,8% mean · −49,4% p99 · baseline: Scheduler comparado · contexto: Tres DAG sintéticos
En MetaGPT-TL, TOPAS reporta reducciones de 22,0% en mean JCT y 26,6% en p99; MetaGPT-SOP reporta 9,8% en mean.
−22,0%/−26,6% TL · −9,8% SOP · baseline: Scheduler comparado · contexto: Dos workflows MetaGPT
El overhead de decisión de TOPAS es 1,9 ms y 0,31% del wall time en la evaluación reportada.
1,9 ms · 0,31% · baseline: Tiempo total del workflow · contexto: Análisis de overhead
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PREGUNTA / TOPAS estudia si el servidor puede aprovechar la estructura de dependencia de un workflow de agentes para reducir el tiempo de finalización.
MÉTODO / El scheduler observa el DAG y toma decisiones de colocación/ordenación sobre SGLang v0.5.3 y Qwen2.5-32B-Instruct en una A100 de 80GB.
RESULTADO / Las reducciones máximas reportadas son 39,8% de mean JCT y 49,4% de p99 en DAG sintéticos; en MetaGPT-TL se reportan 22,0% y 26,6%.
LÍMITE / El resultado es de serving bajo una configuración concreta. Hay que probar carga, concurrencia y fallos del worker antes de tratarlo como una mejora del producto.
Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
- PROBLEMA
- Servir cada llamada de un workflow como una petición independiente ignora dependencias, colas y oportunidades de agrupar etapas compatibles.
- MÉTODO
- TOPAS modela cada workflow de agente como un DAG y usa la topología para tomar decisiones de scheduling. La evaluación corre con SGLang v0.5.3, Qwen2.5-32B-Instruct y una NVIDIA A100 de 80GB sobre tres DAG sintéticos y dos workflows MetaGPT.
- TIPO DE EVIDENCIA
- La fuente reporta reducciones máximas de mean/p99 JCT de 39,8%/49,4% en DAG sintéticos; en los workflows MetaGPT registra 9,8% para SOP y 22,0%/26,6% para TL. El overhead de decisión es 1,9 ms y 0,31% del wall time.
- LÍMITE
- Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
TOPAS modela cada workflow de agente como un DAG y usa la topología para tomar decisiones de scheduling. La evaluación corre con SGLang v0.5.3, Qwen2.5-32B-Instruct y una NVIDIA A100 de 80GB sobre tres DAG sintéticos y dos workflows MetaGPT.
Muestra que la optimización del agente no termina en el prompt o el modelo: el scheduler puede cambiar el coste temporal de la misma política.
Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
Cómo lo llevaría a un proyecto
Instrumentar el DAG de cada workflow y comparar scheduling topology-aware contra FIFO con la misma política, modelo, concurrencia y resultados.
Preguntas que conviene probar
- ¿Qué topologías y cargas obtienen realmente la ganancia?
- ¿El scheduler modifica la semántica o sólo el orden compatible de ejecución?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La latencia de un agente es una propiedad del grafo completo, no sólo del número de tokens generados.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.