# MetaStrategy: Generative Ranking with Executable LLM Strategies
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/metastrategy-ranking
- Fuente primaria: https://arxiv.org/abs/2608.09440
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Chengyu Lai, Jiuning Lin, Zhibo Xiao y colaboradores; Taobao & Tmall Group of Alibaba
- Fecha del corte: 10 AGO 2026
- Área: RANKING · RECOMMENDACIÓN · SLM

## Tesis y contexto

MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.

- Problema: Un ranking end-to-end generado por un LLM es difícil de combinar con reglas de negocio, modelos existentes, guardrails y requisitos de latencia.
- Por qué importa: Es una de las señales más claras de puente entre investigación y producción: una capa generativa decide la política, pero la ejecución sigue siendo controlable y medible.

## Evidencia reportada

- **reported-result**: En un A/B online aleatorizado de siete días en Taobao, MetaStrategy mejora 2,11% los click page views, 3,12% las vistas de detalle y 2,83% el importe de transacción sin aumento observable del tiempo de respuesta. [localizador](https://arxiv.org/html/2608.09440v1#S4)

## Lectura y límite

- Método: Hace que el modelo genere una estrategia estructurada de ranking y deja que un compilador determinista aplique pesos, restricciones y políticas al sistema existente.
- Límite: Una estrategia expresable no es automáticamente una estrategia buena: hay que vigilar objetivos, sesgos y efectos de segundo orden.
- Confianza editorial: Media
- Limitación: El A/B dura siete días y se realiza en una superficie concreta de Taobao; los efectos sobre usuarios, catálogo, vendedores y temporadas distintas no se pueden generalizar directamente.
- Limitación: Los objetivos del JSON y sus proxies pueden optimizar el ranking incumbente sin capturar diversidad, satisfacción a largo plazo, equidad o cambios de inventario.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.09440): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.09440v1): tipo abstract
- [Experimento online · §4](https://arxiv.org/html/2608.09440v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.09440): tipo abstract

## Próxima prueba

- ¿Una estrategia generada y compilada mejora el ranking manteniendo latencia, diversidad y restricciones de negocio fuera del periodo original?
- Métrica: CTR, vistas de detalle, valor de transacción, diversidad, violaciones de reglas y latencia p95.
- Regla de parada: Parar si una métrica de negocio cae 2%, la diversidad cae 5% o la latencia p95 aumenta 10%.

## Recursos reproducibles
- [HTML · fuente primaria](https://arxiv.org/html/2608.09440v1)

## Enlaces relacionados

- [Mechanism Design for Generative Engine](https://luiseduardodemiguel.com/research-ia/markdown/papers/mechanism-design-generative-engines)
- [TTT-Embed](https://luiseduardodemiguel.com/research-ia/markdown/papers/ttt-embed)
- [SAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/sag)