Este corte cruza GEO, búsqueda generativa, discovery para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 14 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes
modela la relación entre creadores de contenido y motores generativos como un juego repetido. Los creadores optimizan sus páginas para conseguir citas, mientras la plataforma intenta preservar calidad y atribución. El paper muestra que las defensas convencionales pueden desencadenar una carrera adaptativa donde cada iteración de GEO introduce más afirmaciones no sustentadas. Propone VCR, Verifiable-Content Rewards, que premia contenido verificable en vez de limitarse a castigar manipulación. La pregunta de producto que queda abierta es: GEO puede evolucionar hacia algo parecido al spam SEO: todos optimizan para ser citados hasta degradar el ecosistema. Por qué puede ser importante: probablemente es el paper más estratégico de la semana para la economía de asistentes. Sugiere que ChatGPT/Google/Gemini-like systems necesitarán cambiar los incentivos de citación, no solamente sus filtros.
The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
mantiene prácticamente iguales las capacidades disponibles y cambia solo cómo se exponen las herramientas al agente. En 11.700 trayectorias y seis arquitecturas, demuestra que la interfaz altera significativamente comportamiento y coste. Interfaces estructuradas mejoran hasta 4,7× la consistencia; búsqueda en lenguaje natural aumenta >11% el acceso a archivos relevantes; CodeAct con Python logra rendimiento similar usando 41,6% menos pasos y 56,3% menos tokens. La pregunta de producto que queda abierta es: solemos atribuir el éxito del agente al modelo aunque gran parte proceda de su API/harness.
SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
usa un modelo fuerte como actor/crítico para producir skills en lenguaje natural específicamente adaptadas a modelos pequeños. Toda la señal de RL se propaga mediante lenguaje, sin modificar directamente el executor pequeño. En Qwen3.5-9B y 4B obtiene mejoras absolutas de hasta 20,4 y 13,3 puntos respectivamente; en SkillsBench, el 9B llega a igualar modelos cerrados fuertes en tareas single-skill. La pregunta de producto que queda abierta es: un skill escrito para un frontier model no necesariamente funciona bien con un SLM.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
09
GEO · DISCOVERY · INCENTIVOS
Mechanism Design for Generative Engine
El descubrimiento dentro de un motor generativo no es solo un problema de contenido: es un problema de incentivos entre quien publica y quien decide qué citar.
Marco teórico y simulaciones de mecanismos; la señal es conceptual y todavía necesita validación en motores y mercados reales.
Un modelo fuerte puede enseñar a un modelo pequeño a ejecutar mejor, no transfiriendo pesos, sino produciendo skills que le resulten realmente ejecutables.
Resultados experimentales sobre extracción y ejecución de skills en modelos pequeños; la propuesta depende de que el procedimiento sea observable y evaluable.
El agente empresarial no falla al pulsar una API: falla al conectar entidades, documentos, APIs y políticas sin perder el hilo.
Benchmark con miles de APIs ejecutables y dominios heterogéneos; ofrece una medida más cercana a la composición enterprise que los tests de herramienta aislados.
Un skill puede convertirse en una dependencia maliciosa: el comportamiento peligroso puede permanecer dormido hasta que aparece un disparador aparentemente inocuo.
Ataque experimental sobre skills de agentes; sirve como señal de threat model, no como estimación de frecuencia de ataques reales.
Reintentar no es una estrategia: primero hay que saber qué clase de fallo ocurrió.
Evaluación de recuperación selectiva en tareas agentic; la aportación está en el diagnóstico y el enrutamiento, no en pedir al modelo que reflexione indefinidamente.
El LLM no tiene que ordenar directamente: puede generar una estrategia estructurada que un compilador determinista aplica al ranking real.
Evaluación en escenarios de recomendación con una representación ejecutable de la política; el puente con producción está en separar decisión de ejecución.
Comparar cómo cambian las features al añadir visión permite convertir la interpretabilidad multimodal en una interfaz de auditoría y control.
Análisis de representaciones y experimentos de intervención sobre capacidades multimodales; es una herramienta de auditoría más que un benchmark de producto.
Abrir Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes y localizar su resultado principal en la fuente primaria.
Contrastar The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR
La señal también tiene sombra.
Una ficha abierta no equivale a una recomendación de adopción.
Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.