NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
14 señales encontradas · mostrando 14 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
10–16 AGOSTO 2026 · #01Imprescindible

Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes

Chen Xu, Zitian Guo, Chenyan Xiong. · 11 agosto 2026.

IDEA CENTRAL

modela la relación entre creadores de contenido y motores generativos como un juego repetido. Los creadores optimizan sus páginas para conseguir citas, mientras la plataforma intenta preservar calidad y atribución. El paper muestra que las defensas convencionales pueden desencadenar una carrera adaptativa donde cada iteración de GEO introduce más afirmaciones no sustentadas. Propone VCR, Verifiable-Content Rewards, que premia contenido verificable en vez de limitarse a castigar manipulación.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

GEO puede evolucionar hacia algo parecido al spam SEO: todos optimizan para ser citados hasta degradar el ecosistema. Por qué puede ser importante: probablemente es el paper más estratégico de la semana para la economía de asistentes. Sugiere que ChatGPT/Google/Gemini-like systems necesitarán cambiar los incentivos de citación, no solamente sus filtros.

GEO, búsqueda generativa, discovery, seguridad económica.GEO/LLMOmotores de respuesta
10–16 AGOSTO 2026 · #02Imprescindible

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang; Purdue, Microsoft Research y University of Chicago. · 11 agosto 2026.

IDEA CENTRAL

mantiene prácticamente iguales las capacidades disponibles y cambia solo cómo se exponen las herramientas al agente. En 11.700 trayectorias y seis arquitecturas, demuestra que la interfaz altera significativamente comportamiento y coste. Interfaces estructuradas mejoran hasta 4,7× la consistencia; búsqueda en lenguaje natural aumenta >11% el acceso a archivos relevantes; CodeAct con Python logra rendimiento similar usando 41,6% menos pasos y 56,3% menos tokens.

POR QUÉ IMPORTA

confirma una tesis cada vez más fuerte: modelo + herramientas no basta; la arquitectura de interacción es una ventaja competitiva propia.

Ver problema que intenta resolver

solemos atribuir el éxito del agente al modelo aunque gran parte proceda de su API/harness.

agentes, coding agents, harness engineering.Codex-like agentsIDEs
10–16 AGOSTO 2026 · #03Imprescindible

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li. · 11 agosto 2026.

IDEA CENTRAL

usa un modelo fuerte como actor/crítico para producir skills en lenguaje natural específicamente adaptadas a modelos pequeños. Toda la señal de RL se propaga mediante lenguaje, sin modificar directamente el executor pequeño. En Qwen3.5-9B y 4B obtiene mejoras absolutas de hasta 20,4 y 13,3 puntos respectivamente; en SkillsBench, el 9B llega a igualar modelos cerrados fuertes en tareas single-skill.

POR QUÉ IMPORTA

abre una arquitectura económicamente potente: frontier model diseña skills → SLM barato ejecuta repetidamente.

Ver problema que intenta resolver

un skill escrito para un frontier model no necesariamente funciona bien con un SLM.

SLM, skills, agentes, RL.agentes localesautomatizaciones empresariales
10–16 AGOSTO 2026 · #04Imprescindible

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor. · 12 agosto 2026.

IDEA CENTRAL

benchmark con más de 8.000 APIs ejecutables en 62 dominios y tareas que combinan APIs, documentos y restricciones expresadas en lenguaje natural. Incluso el mejor modelo baja de 70,4% en tareas endpoint simples a \~50–51% en APIs composicionales; con más hops el rendimiento cae más del 50%. En preguntas imposibles bajo políticas de uso, algunos resultados bajan hasta 2,4%.

POR QUÉ IMPORTA

expone que el cuello de botella ya no es “saber llamar una API”, sino desambiguar entidades, combinar fuentes y respetar políticas.

Ver problema que intenta resolver

los benchmarks suelen evaluar tool-use y retrieval por separado, pero las empresas necesitan ambas capacidades simultáneamente.

agentes empresariales, APIs, RAG, evaluación.CRMERP
10–16 AGOSTO 2026 · #05Imprescindible

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li. · 12 agosto 2026.

IDEA CENTRAL

evita construir un knowledge graph global. Cada chunk se almacena como un evento semánticamente completo + sus entidades. En tiempo de consulta, SQL usa entidades compartidas como joins y construye dinámicamente un vecindario tipo hipergrafo. Así mantiene intactos los documentos originales y evita fragmentarlos en triples.

POR QUÉ IMPORTA

es extremadamente atractivo para conocimiento corporativo mutable. En MuSiQue alcanza 80,36% Recall\@5, 11,52 puntos sobre el mejor baseline comparado.

Ver problema que intenta resolver

GraphRAG aporta estructura, pero genera coste de construcción, mantenimiento y actualizaciones.

RAG, enterprise search, structured retrieval.documentación internaCRM
10–16 AGOSTO 2026 · #06Imprescindible

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng. · 10 agosto 2026.

IDEA CENTRAL

no intenta mejorar el skill, sino garantizar que el agente realmente siga el procedimiento. Construye una DSL de runtime guidance a partir del skill y de ejecuciones anteriores, monitoriza cada ejecución y actualiza esa guía usando nuevas trazas. Sobre 15 skills y agentes Claude Code/Codex con varios modelos aumenta de media el éxito un 24,1% y reduce variabilidad.

POR QUÉ IMPORTA

los skills empiezan a parecerse a procedimientos verificables, no simples prompts.

Ver problema que intenta resolver

disponer de una buena receta no garantiza que el LLM la siga consistentemente.

skills, reliability, agentes.SOPscoding agents
10–16 AGOSTO 2026 · #07Imprescindible

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu. · 10 agosto 2026.

IDEA CENTRAL

demuestra que un único skill puede esconder una regla maliciosa que permanece inactiva hasta detectar un trigger aparentemente inocuo dentro de la consulta. El ataque no necesita modificar pesos y mantiene comportamiento normal cuando no aparece el trigger. Los autores reportan alta tasa de ataque, falsos positivos cercanos a cero y transferencia entre cuatro familias de modelos.

POR QUÉ IMPORTA

un SKILL.md debe empezar a tratarse como tratamos una dependencia npm/pip: procedencia, permisos, sandbox y auditoría.

Ver problema que intenta resolver

los skills descargados se están convirtiendo en una nueva cadena de suministro de software.

agent safety, skills, supply-chain security.scanners de skillsmarketplaces seguros
10–16 AGOSTO 2026 · #08Imprescindible

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong; Ant International. · 12 agosto 2026.

IDEA CENTRAL

sostiene que “reflexiona e inténtalo otra vez” es demasiado genérico. Diferentes fallos requieren diferentes estrategias: error de acción, esquema inválido, evidencia insuficiente, ruta API incorrecta, etc. El sistema primero diagnostica la clase de error y solo entonces aplica el recovery correspondiente.

POR QUÉ IMPORTA

podría ser una pieza fundamental de agentes robustos: failure routing, equivalente a manejo de excepciones semántico.

Ver problema que intenta resolver

añadir más contexto o reflexión puede incluso empeorar una trayectoria si el mecanismo de recuperación no coincide con el error.

reasoning, agentes, self-correction.coding agentsRPA
10–16 AGOSTO 2026 · #09Imprescindible

MetaStrategy: Generative Ranking with Executable LLM Strategies

Chengyu Lai et al. · 10 agosto 2026.

IDEA CENTRAL

en vez de pedir al LLM que genere directamente el ranking, genera una estrategia estructurada en JSON: pesos de objetivos, preferencias, restricciones y políticas de posición. Un compilador determinista la aplica al ranking real. Además, destila profesores de 4B en un estudiante de 0,8B.

POR QUÉ IMPORTA

tiene una señal de adopción excepcional: se desplegó en Taobao. En un A/B test de siete días reporta +2,11% click PV, +3,12% item-detail PV y +2,83% transaction amount, sin añadir latencia observable al ranking síncrono.

Ver problema que intenta resolver

los rankings generativos end-to-end son difíciles de combinar con reglas de negocio, modelos existentes y guardrails.

recomendación, ranking, discovery, SLM.marketplacesfeeds
10–16 AGOSTO 2026 · #10Interesante

Test-Time Optimization of Query Embeddings with Ranking-Aware Reward Maximization

Tianyu Chen, Jiaxing Wu. · 12 agosto 2026.

IDEA CENTRAL

TTT-Embed aprende en tiempo de inferencia un pequeño vector en el espacio de embeddings usando únicamente scores de ranking de un reranker o LLM judge. No cambia el retriever ni el índice y funciona incluso con APIs cerradas. La política puede reutilizarse globalmente, por tarea o por query.

POR QUÉ IMPORTA

convierte la señal del reranker en memoria adaptativa del propio retrieval. Reporta hasta +8,36 nDCG\@10 y generalización a queries/tareas no vistas.

Ver problema que intenta resolver

los rerankers producen información valiosa pero normalmente se descarta después de cada consulta.

retrieval, embeddings, search.RAGenterprise search
10–16 AGOSTO 2026 · #11Interesante

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mengru Wang, Junfeng Fang, Shuofei Qiao et al.; Zhejiang University, NUS, UCSD y colaboradores. · 12 agosto 2026.

IDEA CENTRAL

automatiza investigación de interpretabilidad mediante un ciclo hipótesis → experimento → verificación → iteración. Combina un knowledge graph específico de interpretabilidad de \~13.000 papers con una base interdisciplinar de 43 millones de trabajos. Mantiene humanos definiendo objetivos y criterios científicos.

POR QUÉ IMPORTA

es un ejemplo fuerte de “AI scientist” con un dominio bien acotado y verificable, en vez de intentar automatizar toda la ciencia.

Ver problema que intenta resolver

la capacidad de los modelos evoluciona más rápido que nuestra capacidad de comprender sus mecanismos internos.

agentes científicos, interpretabilidad, reasoning.interpretabilidadred-teaming
10–16 AGOSTO 2026 · #12Interesante

MMDiff: Multimodal Model Diffing for Feature Discovery and Control

trabajo sobre LLaVA-MORE, PaliGemma 2 e InternVL3.5. · agosto 2026, dentro de la ventana de la semana.

IDEA CENTRAL

compara sparse autoencoders del backbone lingüístico y del modelo multimodal para identificar qué features internas fueron alteradas por el entrenamiento visual. Después usa esas features para controlar capacidades o seguridad. Eliminar ciertas direcciones reduce específicamente 12% las tareas espaciales, 17% OCR y 24% el éxito de ataques multimodales, sin perjudicar VQA general; steering también mejora tareas objetivo.

POR QUÉ IMPORTA

convierte interpretabilidad en un mecanismo de control causal, no únicamente visualización post-hoc.

Ver problema que intenta resolver

no sabemos qué parte del comportamiento de un MLLM apareció específicamente al añadir visión.

multimodalidad, interpretabilidad, safety.safety multimodalauditoría
10–16 AGOSTO 2026 · #13Interesante

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

Xiaohongshu Dots Studio, Evolvent AI. · 11 agosto 2026.

IDEA CENTRAL

evalúa agentes durante unas 30 jornadas simuladas y 24 etapas, incluyendo eventos que ocurren sin notificación. El agente tiene que volver a comprobar el mundo por iniciativa propia, mantener compromisos y recordar restricciones persistentes como pasaportes, trámites o riesgos de phishing.

POR QUÉ IMPORTA

introduce una dimensión poco evaluada: proactividad temporal. Un asistente personal útil no solo recuerda; debe saber cuándo volver a mirar.

Ver problema que intenta resolver

los benchmarks suelen esperar que el usuario desencadene cada acción; la vida real continúa aunque nadie escriba al agente.

memoria, agentes personales, evaluación long-horizon.asistentes familiaresviajes
10–16 AGOSTO 2026 · #14Vigilar

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim. · 12 agosto 2026.

IDEA CENTRAL

MBA-Bench contiene 30.000 muestras en seis dominios donde las ideas de negocio deben derivarse de señales visuales que el texto por sí solo no captura. El pipeline combina imagen, caption, queries extraídas visualmente y evidencia de mercado recuperada de la web.

POR QUÉ IMPORTA

abre un espacio interesante para agentes capaces de observar productos, espacios, comercios o procesos y conectarlos con información de mercado.

Ver problema que intenta resolver

la ideación empresarial agentic se evalúa casi siempre sobre texto, aunque las oportunidades del mundo físico son visuales.

multimodalidad, enterprise AI, agents.estudios de mercadoretail intelligence