Lo esencial antes de invertir más tiempo.
Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.
El módulo de alignment alcanza 98,85% de accuracy y se evalúa con experimentos A/B online sobre tráfico de producción.
Resultado reportado con fuente enlazada · 3 localizadores disponibles.Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.
Relevancia, diversidad, satisfacción, edición de preferencias y exposición a contenido no deseado.
Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.
Qué está reportado y qué conviene comprobar.
El módulo de alignment alcanza 98,85% de accuracy y se evalúa con experimentos A/B online sobre tráfico de producción.
98,85% de accuracy · contexto: Experimentos A/B online sobre tráfico de producción
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.Shape Your Feed parte de una fricción conocida: un recomendador puede observar clics y tiempo de lectura, pero no sabe necesariamente que la persona quiere menos clickbait, más publicaciones de amigos o contenido de una profundidad concreta. El usuario tiene una intención explícita que el ranking pasivo no siempre puede escuchar.
SYF combina texto, voz y controles de UI en un Perception Flow que normaliza preferencias. Un Serving Flow usa un perfil semántico persistente para rerankear y podar candidatos en tiempo real, y un Self-Evolution Flow ajusta el comportamiento con DPO y un ensemble de jueces LLM.
El módulo de alignment alcanza 98,85% de accuracy en la evaluación descrita y el sistema se prueba con A/B online sobre tráfico de producción. Los autores reportan mejoras de relevancia y sentimiento, una señal más cercana a producto que un benchmark offline, aunque no convierte el resultado en una garantía para cualquier dominio.
La lectura estratégica es que el discovery pasa de inferir silenciosamente a negociar preferencias. El punto delicado es la memoria: una preferencia persistente puede ayudar mañana o deformar el feed durante meses. Un producto responsable debería mostrar qué cree el sistema, permitir corregirlo y medir si la intervención se puede deshacer.
Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.
- PROBLEMA
- Los recomendadores pasivos infieren preferencias de comportamiento aunque el usuario pueda expresar con precisión qué quiere más o menos en ese momento.
- MÉTODO
- Organiza tres flujos: percepción de intención multimodal, serving con reranking y pruning sobre un Semantic Profile persistente, y self-evolution con DPO y un ensemble LLM-as-a-Judge.
- TIPO DE EVIDENCIA
- El paper reporta 98,85% de accuracy en su módulo de alignment y experimentos A/B online sobre tráfico de producción con mejoras de relevancia y sentimiento del usuario.
- LÍMITE
- Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.
El usuario puede expresarse y corregir lo que el sistema cree que quiere.
La personalización gana valor cuando la memoria de preferencias es visible y reversible.
No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.
Abrir fuente primaria ↗La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
Organiza tres flujos: percepción de intención multimodal, serving con reranking y pruning sobre un Semantic Profile persistente, y self-evolution con DPO y un ensemble LLM-as-a-Judge.
La recomendación agentic convierte el discovery en una conversación controlable y conecta la evolución del perfil con feedback humano y A/B testing de producción.
Los detalles de la evaluación online y el sistema de producción no son equivalentes a una receta abierta; un perfil semántico persistente también puede amplificar errores de interpretación o preferencias antiguas.
Cómo lo llevaría a un proyecto
Añadir a un feed un canal explícito de preferencias con tres acciones —más, menos y por qué— y medir satisfacción, diversidad y reversibilidad frente al ranking pasivo.
Preguntas que conviene probar
- ¿Qué preferencias merecen persistir y cuáles solo aplican a esta sesión?
- ¿Cómo puede el usuario corregir una inferencia del perfil sin luchar contra el sistema?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
El siguiente salto del discovery no es solo predecir mejor: es dejar que la persona module activamente el espacio de posibilidades.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.