NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 09

DISCOVERY · RECOMENDACIÓN · AGENTES

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

ImprescindibleLectura primaria completa

El usuario deja de ser una señal pasiva de clics y empieza a co-curar explícitamente lo que el sistema debe mostrarle.

AUTHORS / LABZiyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song y colaboradores; sistema industrial de recomendación
FECHA06 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

EVIDENCIA DISPONIBLE

El módulo de alignment alcanza 98,85% de accuracy y se evalúa con experimentos A/B online sobre tráfico de producción.

Resultado reportado con fuente enlazada · 3 localizadores disponibles.
LÍMITE

Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.

SIGUIENTE PRUEBA

Relevancia, diversidad, satisfacción, edición de preferencias y exposición a contenido no deseado.

EN UNA FRASE

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

SEÑALDiscovery · Recomendación · Agentes
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

El módulo de alignment alcanza 98,85% de accuracy y se evalúa con experimentos A/B online sobre tráfico de producción.

98,85% de accuracy · contexto: Experimentos A/B online sobre tráfico de producción

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

Shape Your Feed parte de una fricción conocida: un recomendador puede observar clics y tiempo de lectura, pero no sabe necesariamente que la persona quiere menos clickbait, más publicaciones de amigos o contenido de una profundidad concreta. El usuario tiene una intención explícita que el ranking pasivo no siempre puede escuchar.

SYF combina texto, voz y controles de UI en un Perception Flow que normaliza preferencias. Un Serving Flow usa un perfil semántico persistente para rerankear y podar candidatos en tiempo real, y un Self-Evolution Flow ajusta el comportamiento con DPO y un ensemble de jueces LLM.

El módulo de alignment alcanza 98,85% de accuracy en la evaluación descrita y el sistema se prueba con A/B online sobre tráfico de producción. Los autores reportan mejoras de relevancia y sentimiento, una señal más cercana a producto que un benchmark offline, aunque no convierte el resultado en una garantía para cualquier dominio.

La lectura estratégica es que el discovery pasa de inferir silenciosamente a negociar preferencias. El punto delicado es la memoria: una preferencia persistente puede ayudar mañana o deformar el feed durante meses. Un producto responsable debería mostrar qué cree el sistema, permitir corregirlo y medir si la intervención se puede deshacer.

DECISIÓN RÁPIDAAñadir a un feed un canal explícito de preferencias con tres acciones —más, menos y por qué— y medir satisfacción, diversidad y reversibilidad frente al ranking pasivo.
NO LO SOBREINTERPRETES

Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.

PROBLEMA
Los recomendadores pasivos infieren preferencias de comportamiento aunque el usuario pueda expresar con precisión qué quiere más o menos en ese momento.
MÉTODO
Organiza tres flujos: percepción de intención multimodal, serving con reranking y pruning sobre un Semantic Profile persistente, y self-evolution con DPO y un ensemble LLM-as-a-Judge.
TIPO DE EVIDENCIA
El paper reporta 98,85% de accuracy en su módulo de alignment y experimentos A/B online sobre tráfico de producción con mejoras de relevancia y sentimiento del usuario.
LÍMITE
Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.
FIGURA DE LECTURA / DISCOVERYPreferencia → perfil → feed negociable
Abrir paper original ↗

El usuario puede expresarse y corregir lo que el sistema cree que quiere.

DECIRTexto, voz o control
REORDENARRerank y prune
APRENDERFeedback y DPO
PARA RECORDAR

La personalización gana valor cuando la memoria de preferencias es visible y reversible.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / El paper reporta 98,85% de accuracy en su módulo de alignment y experimentos A/B online sobre tráfico de producción con mejoras de relevancia y sentimiento del usuario.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Organiza tres flujos: percepción de intención multimodal, serving con reranking y pruning sobre un Semantic Profile persistente, y self-evolution con DPO y un ensemble LLM-as-a-Judge.

QUÉ APORTA

La recomendación agentic convierte el discovery en una conversación controlable y conecta la evolución del perfil con feedback humano y A/B testing de producción.

QUÉ NO PRUEBA

Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.

Cómo lo llevaría a un proyecto

Añadir a un feed un canal explícito de preferencias con tres acciones —más, menos y por qué— y medir satisfacción, diversidad y reversibilidad frente al ranking pasivo.

FeedsMarketplacesShopping agentsContenidoDescubrimiento conversacional

Preguntas que conviene probar

  • ¿Qué preferencias merecen persistir y cuáles solo aplican a esta sesión?
  • ¿Cómo puede el usuario corregir una inferencia del perfil sin luchar contra el sistema?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADACohorte controlada de dos semanas con preferencias editables, guardrails de seguridad y grupos de usuarios comparables.
PREGUNTA¿Un módulo de alignment configurable mejora relevancia sin reducir diversidad ni aumentar exposición no deseada?
MÉTRICARelevancia, diversidad, satisfacción, edición de preferencias y exposición a contenido no deseado.
PARADAParar si la diversidad cae 5% o si la exposición no deseada aumenta 1 punto porcentual.

Mi lectura

El siguiente salto del discovery no es solo predecir mejor: es dejar que la persona module activamente el espacio de posibilidades.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.