10–16 AGOSTO 2026 · #01Imprescindible
Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes
Chen Xu, Zitian Guo, Chenyan Xiong. · 11 agosto 2026.
IDEA CENTRALmodela la relación entre creadores de contenido y motores generativos como un juego repetido. Los creadores optimizan sus páginas para conseguir citas, mientras la plataforma intenta preservar calidad y atribución. El paper muestra que las defensas convencionales pueden desencadenar una carrera adaptativa donde cada iteración de GEO introduce más afirmaciones no sustentadas. Propone VCR, Verifiable-Content Rewards, que premia contenido verificable en vez de limitarse a castigar manipulación.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
GEO puede evolucionar hacia algo parecido al spam SEO: todos optimizan para ser citados hasta degradar el ecosistema. Por qué puede ser importante: probablemente es el paper más estratégico de la semana para la economía de asistentes. Sugiere que ChatGPT/Google/Gemini-like systems necesitarán cambiar los incentivos de citación, no solamente sus filtros.
GEO, búsqueda generativa, discovery, seguridad económica.GEO/LLMOmotores de respuesta
10–16 AGOSTO 2026 · #02Imprescindible
The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang; Purdue, Microsoft Research y University of Chicago. · 11 agosto 2026.
IDEA CENTRALmantiene prácticamente iguales las capacidades disponibles y cambia solo cómo se exponen las herramientas al agente. En 11.700 trayectorias y seis arquitecturas, demuestra que la interfaz altera significativamente comportamiento y coste. Interfaces estructuradas mejoran hasta 4,7× la consistencia; búsqueda en lenguaje natural aumenta >11% el acceso a archivos relevantes; CodeAct con Python logra rendimiento similar usando 41,6% menos pasos y 56,3% menos tokens.
POR QUÉ IMPORTAconfirma una tesis cada vez más fuerte: modelo + herramientas no basta; la arquitectura de interacción es una ventaja competitiva propia.
Ver problema que intenta resolver
solemos atribuir el éxito del agente al modelo aunque gran parte proceda de su API/harness.
agentes, coding agents, harness engineering.Codex-like agentsIDEs
10–16 AGOSTO 2026 · #04Imprescindible
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor. · 12 agosto 2026.
IDEA CENTRALbenchmark con más de 8.000 APIs ejecutables en 62 dominios y tareas que combinan APIs, documentos y restricciones expresadas en lenguaje natural. Incluso el mejor modelo baja de 70,4% en tareas endpoint simples a \~50–51% en APIs composicionales; con más hops el rendimiento cae más del 50%. En preguntas imposibles bajo políticas de uso, algunos resultados bajan hasta 2,4%.
POR QUÉ IMPORTAexpone que el cuello de botella ya no es “saber llamar una API”, sino desambiguar entidades, combinar fuentes y respetar políticas.
Ver problema que intenta resolver
los benchmarks suelen evaluar tool-use y retrieval por separado, pero las empresas necesitan ambas capacidades simultáneamente.
agentes empresariales, APIs, RAG, evaluación.CRMERP
10–16 AGOSTO 2026 · #05Imprescindible
SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges
Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li. · 12 agosto 2026.
IDEA CENTRALevita construir un knowledge graph global. Cada chunk se almacena como un evento semánticamente completo + sus entidades. En tiempo de consulta, SQL usa entidades compartidas como joins y construye dinámicamente un vecindario tipo hipergrafo. Así mantiene intactos los documentos originales y evita fragmentarlos en triples.
POR QUÉ IMPORTAes extremadamente atractivo para conocimiento corporativo mutable. En MuSiQue alcanza 80,36% Recall\@5, 11,52 puntos sobre el mejor baseline comparado.
Ver problema que intenta resolver
GraphRAG aporta estructura, pero genera coste de construcción, mantenimiento y actualizaciones.
RAG, enterprise search, structured retrieval.documentación internaCRM
10–16 AGOSTO 2026 · #06Imprescindible
SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
You Lu, Xinyu Huang, Bihuan Chen, Xin Peng. · 10 agosto 2026.
IDEA CENTRALno intenta mejorar el skill, sino garantizar que el agente realmente siga el procedimiento. Construye una DSL de runtime guidance a partir del skill y de ejecuciones anteriores, monitoriza cada ejecución y actualiza esa guía usando nuevas trazas. Sobre 15 skills y agentes Claude Code/Codex con varios modelos aumenta de media el éxito un 24,1% y reduce variabilidad.
POR QUÉ IMPORTAlos skills empiezan a parecerse a procedimientos verificables, no simples prompts.
Ver problema que intenta resolver
disponer de una buena receta no garantiza que el LLM la siga consistentemente.
skills, reliability, agentes.SOPscoding agents
10–16 AGOSTO 2026 · #07Imprescindible
ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills
Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu. · 10 agosto 2026.
IDEA CENTRALdemuestra que un único skill puede esconder una regla maliciosa que permanece inactiva hasta detectar un trigger aparentemente inocuo dentro de la consulta. El ataque no necesita modificar pesos y mantiene comportamiento normal cuando no aparece el trigger. Los autores reportan alta tasa de ataque, falsos positivos cercanos a cero y transferencia entre cuatro familias de modelos.
POR QUÉ IMPORTAun SKILL.md debe empezar a tratarse como tratamos una dependencia npm/pip: procedencia, permisos, sandbox y auditoría.
Ver problema que intenta resolver
los skills descargados se están convirtiendo en una nueva cadena de suministro de software.
agent safety, skills, supply-chain security.scanners de skillsmarketplaces seguros
10–16 AGOSTO 2026 · #08Imprescindible
Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction
Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong; Ant International. · 12 agosto 2026.
IDEA CENTRALsostiene que “reflexiona e inténtalo otra vez” es demasiado genérico. Diferentes fallos requieren diferentes estrategias: error de acción, esquema inválido, evidencia insuficiente, ruta API incorrecta, etc. El sistema primero diagnostica la clase de error y solo entonces aplica el recovery correspondiente.
POR QUÉ IMPORTApodría ser una pieza fundamental de agentes robustos: failure routing, equivalente a manejo de excepciones semántico.
Ver problema que intenta resolver
añadir más contexto o reflexión puede incluso empeorar una trayectoria si el mecanismo de recuperación no coincide con el error.
reasoning, agentes, self-correction.coding agentsRPA
10–16 AGOSTO 2026 · #09Imprescindible
MetaStrategy: Generative Ranking with Executable LLM Strategies
Chengyu Lai et al. · 10 agosto 2026.
IDEA CENTRALen vez de pedir al LLM que genere directamente el ranking, genera una estrategia estructurada en JSON: pesos de objetivos, preferencias, restricciones y políticas de posición. Un compilador determinista la aplica al ranking real. Además, destila profesores de 4B en un estudiante de 0,8B.
POR QUÉ IMPORTAtiene una señal de adopción excepcional: se desplegó en Taobao. En un A/B test de siete días reporta +2,11% click PV, +3,12% item-detail PV y +2,83% transaction amount, sin añadir latencia observable al ranking síncrono.
Ver problema que intenta resolver
los rankings generativos end-to-end son difíciles de combinar con reglas de negocio, modelos existentes y guardrails.
recomendación, ranking, discovery, SLM.marketplacesfeeds
10–16 AGOSTO 2026 · #10Interesante
Test-Time Optimization of Query Embeddings with Ranking-Aware Reward Maximization
Tianyu Chen, Jiaxing Wu. · 12 agosto 2026.
IDEA CENTRALTTT-Embed aprende en tiempo de inferencia un pequeño vector en el espacio de embeddings usando únicamente scores de ranking de un reranker o LLM judge. No cambia el retriever ni el índice y funciona incluso con APIs cerradas. La política puede reutilizarse globalmente, por tarea o por query.
POR QUÉ IMPORTAconvierte la señal del reranker en memoria adaptativa del propio retrieval. Reporta hasta +8,36 nDCG\@10 y generalización a queries/tareas no vistas.
Ver problema que intenta resolver
los rerankers producen información valiosa pero normalmente se descarta después de cada consulta.
retrieval, embeddings, search.RAGenterprise search
10–16 AGOSTO 2026 · #11Interesante
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Mengru Wang, Junfeng Fang, Shuofei Qiao et al.; Zhejiang University, NUS, UCSD y colaboradores. · 12 agosto 2026.
IDEA CENTRALautomatiza investigación de interpretabilidad mediante un ciclo hipótesis → experimento → verificación → iteración. Combina un knowledge graph específico de interpretabilidad de \~13.000 papers con una base interdisciplinar de 43 millones de trabajos. Mantiene humanos definiendo objetivos y criterios científicos.
POR QUÉ IMPORTAes un ejemplo fuerte de “AI scientist” con un dominio bien acotado y verificable, en vez de intentar automatizar toda la ciencia.
Ver problema que intenta resolver
la capacidad de los modelos evoluciona más rápido que nuestra capacidad de comprender sus mecanismos internos.
agentes científicos, interpretabilidad, reasoning.interpretabilidadred-teaming
10–16 AGOSTO 2026 · #12Interesante
MMDiff: Multimodal Model Diffing for Feature Discovery and Control
trabajo sobre LLaVA-MORE, PaliGemma 2 e InternVL3.5. · agosto 2026, dentro de la ventana de la semana.
IDEA CENTRALcompara sparse autoencoders del backbone lingüístico y del modelo multimodal para identificar qué features internas fueron alteradas por el entrenamiento visual. Después usa esas features para controlar capacidades o seguridad. Eliminar ciertas direcciones reduce específicamente 12% las tareas espaciales, 17% OCR y 24% el éxito de ataques multimodales, sin perjudicar VQA general; steering también mejora tareas objetivo.
POR QUÉ IMPORTAconvierte interpretabilidad en un mecanismo de control causal, no únicamente visualización post-hoc.
Ver problema que intenta resolver
no sabemos qué parte del comportamiento de un MLLM apareció específicamente al añadir visión.
multimodalidad, interpretabilidad, safety.safety multimodalauditoría
10–16 AGOSTO 2026 · #13Interesante
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
Xiaohongshu Dots Studio, Evolvent AI. · 11 agosto 2026.
IDEA CENTRALevalúa agentes durante unas 30 jornadas simuladas y 24 etapas, incluyendo eventos que ocurren sin notificación. El agente tiene que volver a comprobar el mundo por iniciativa propia, mantener compromisos y recordar restricciones persistentes como pasaportes, trámites o riesgos de phishing.
POR QUÉ IMPORTAintroduce una dimensión poco evaluada: proactividad temporal. Un asistente personal útil no solo recuerda; debe saber cuándo volver a mirar.
Ver problema que intenta resolver
los benchmarks suelen esperar que el usuario desencadene cada acción; la vida real continúa aunque nadie escriba al agente.
memoria, agentes personales, evaluación long-horizon.asistentes familiaresviajes
10–16 AGOSTO 2026 · #14Vigilar
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation
Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim. · 12 agosto 2026.
IDEA CENTRALMBA-Bench contiene 30.000 muestras en seis dominios donde las ideas de negocio deben derivarse de señales visuales que el texto por sí solo no captura. El pipeline combina imagen, caption, queries extraídas visualmente y evidencia de mercado recuperada de la web.
POR QUÉ IMPORTAabre un espacio interesante para agentes capaces de observar productos, espacios, comercios o procesos y conectarlos con información de mercado.
Ver problema que intenta resolver
la ideación empresarial agentic se evalúa casi siempre sobre texto, aunque las oportunidades del mundo físico son visuales.
multimodalidad, enterprise AI, agents.estudios de mercadoretail intelligence