NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 08

AGENTES · SERVING · SISTEMAS

TOPAS: Topology-Aware Scheduling for LLM Agent Workflows

InteresanteLectura primaria completa

Cuando un workflow de agentes tiene forma de grafo, la topología también es una palanca de latencia y utilización.

AUTHORS / LABHongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan
FECHA26 AGO 2026 · v1
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

EVIDENCIA DISPONIBLE

TOPAS reduce mean y p99 JCT hasta 39,8% y 49,4% en los DAG sintéticos evaluados.

Resultado reportado con fuente enlazada · 8 localizadores disponibles.
LÍMITE

Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.

SIGUIENTE PRUEBA

Mean/p99 JCT, throughput, reintentos duplicados, coste por job y completitud.

EN UNA FRASE

TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.

SEÑALDAG scheduling · serving · latencia de workflow
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

TOPAS reduce mean y p99 JCT hasta 39,8% y 49,4% en los DAG sintéticos evaluados.

−39,8% mean · −49,4% p99 · baseline: Scheduler comparado · contexto: Tres DAG sintéticos

RESULTADO REPORTADO

En MetaGPT-TL, TOPAS reporta reducciones de 22,0% en mean JCT y 26,6% en p99; MetaGPT-SOP reporta 9,8% en mean.

−22,0%/−26,6% TL · −9,8% SOP · baseline: Scheduler comparado · contexto: Dos workflows MetaGPT

RESULTADO REPORTADO

El overhead de decisión de TOPAS es 1,9 ms y 0,31% del wall time en la evaluación reportada.

1,9 ms · 0,31% · baseline: Tiempo total del workflow · contexto: Análisis de overhead

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PREGUNTA / TOPAS estudia si el servidor puede aprovechar la estructura de dependencia de un workflow de agentes para reducir el tiempo de finalización.

MÉTODO / El scheduler observa el DAG y toma decisiones de colocación/ordenación sobre SGLang v0.5.3 y Qwen2.5-32B-Instruct en una A100 de 80GB.

RESULTADO / Las reducciones máximas reportadas son 39,8% de mean JCT y 49,4% de p99 en DAG sintéticos; en MetaGPT-TL se reportan 22,0% y 26,6%.

LÍMITE / El resultado es de serving bajo una configuración concreta. Hay que probar carga, concurrencia y fallos del worker antes de tratarlo como una mejora del producto.

DECISIÓN RÁPIDAInstrumentar el DAG de cada workflow y comparar scheduling topology-aware contra FIFO con la misma política, modelo, concurrencia y resultados.
NO LO SOBREINTERPRETES

Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.

PROBLEMA
Servir cada llamada de un workflow como una petición independiente ignora dependencias, colas y oportunidades de agrupar etapas compatibles.
MÉTODO
TOPAS modela cada workflow de agente como un DAG y usa la topología para tomar decisiones de scheduling. La evaluación corre con SGLang v0.5.3, Qwen2.5-32B-Instruct y una NVIDIA A100 de 80GB sobre tres DAG sintéticos y dos workflows MetaGPT.
TIPO DE EVIDENCIA
La fuente reporta reducciones máximas de mean/p99 JCT de 39,8%/49,4% en DAG sintéticos; en los workflows MetaGPT registra 9,8% para SOP y 22,0%/26,6% para TL. El overhead de decisión es 1,9 ms y 0,31% del wall time.
LÍMITE
Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

TOPAS modela cada workflow de agente como un DAG y usa la topología para tomar decisiones de scheduling. La evaluación corre con SGLang v0.5.3, Qwen2.5-32B-Instruct y una NVIDIA A100 de 80GB sobre tres DAG sintéticos y dos workflows MetaGPT.

QUÉ APORTA

Muestra que la optimización del agente no termina en el prompt o el modelo: el scheduler puede cambiar el coste temporal de la misma política.

QUÉ NO PRUEBA

Los números dependen de una GPU, un servidor y topologías controladas. Reducir JCT no garantiza menor coste monetario ni mejor calidad si el scheduler cambia el orden observable de ejecución.

Cómo lo llevaría a un proyecto

Instrumentar el DAG de cada workflow y comparar scheduling topology-aware contra FIFO con la misma política, modelo, concurrencia y resultados.

serving de agentesworkflows DAGorquestadores LLMoptimización de inferencia

Preguntas que conviene probar

  • ¿Qué topologías y cargas obtienen realmente la ganancia?
  • ¿El scheduler modifica la semántica o sólo el orden compatible de ejecución?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAWorkflows DAG internos con cargas baja/media/alta, concurrencia variable y fallos inyectados en nodos.
PREGUNTA¿La planificación por topología mantiene la ganancia bajo concurrencia y fallos?
MÉTRICAMean/p99 JCT, throughput, reintentos duplicados, coste por job y completitud.
PARADAParar si la ganancia desaparece con carga real o si el scheduler aumenta duplicados o pérdida de estado.

Mi lectura

La latencia de un agente es una propiedad del grafo completo, no sólo del número de tokens generados.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.