NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
169 señales encontradas · mostrando 36 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
24–30 AGOSTO 2026 · #01Imprescindible

MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks

Yi Zhu, Xiongwei Wu, Qiyi Wang et al.; MAI Team · 24 agosto 2026; versión v2 25 agosto 2026.

IDEA CENTRAL

Benchmark de 1.705 tareas en 13 dominios y 212 herramientas que separa uso básico, colaboración de subagentes, memoria y skills.

POR QUÉ IMPORTA

Aporta una línea base más cercana al agente móvil de producto y permite fijar gates por capacidad.

Ver problema que intenta resolver

Un único score de éxito oculta si el agente falla por herramienta, memoria, colaboración o skill.

agentes móviles, tool use, memoria, evaluación.copilotos móvilesevaluación de agentes
24–30 AGOSTO 2026 · #02Imprescindible

OODA-Tool: Specialized OODA Loops for Tool-Using Agents

Rongfeng Guo, Yinxuan Huang, Yusen Wu et al. · 25 agosto 2026; versión v2 27 agosto 2026.

IDEA CENTRAL

Especializa observar, orientar, decidir y actuar para mejorar el uso de herramientas en Qwen3 de 0,6B a 14B.

POR QUÉ IMPORTA

Conecta la arquitectura de decisión con una métrica explícita de latencia secuencial.

Ver problema que intenta resolver

Una política única mezcla fases y oculta dónde se pierde exactitud y cuánto cuesta cada llamada.

agentes, tool use, latencia.agentes con APIsorquestación multi-herramienta
24–30 AGOSTO 2026 · #03Imprescindible

AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents

Guo Gan, Yilun Zhao, Cong Chen et al. · 25 agosto 2026; versión v1.

IDEA CENTRAL

Evalúa 236 tareas con anomalías de estado, pensamiento, acción y ronda en 16 modelos GUI.

POR QUÉ IMPORTA

Convierte la degradación ante anomalías en un gate separado del éxito nominal.

Ver problema que intenta resolver

El éxito en una interfaz limpia no muestra cómo responde el agente a un cambio de estado o una instrucción engañosa.

agentes GUI, seguridad, robustez.testing de agentes GUIred teaming
24–30 AGOSTO 2026 · #04Imprescindible

MetaRAG: Meta-Reinforcement Learning for Adaptive Retrieval-Augmented Generation

Qiuyi Qi, Tian Liang, Jiamu Wang et al. · 25 agosto 2026; versión v1.

IDEA CENTRAL

Aprende cuándo recuperar y verificar mediante una política adaptativa con Verify-first Action Generation e Internal Belief Probing.

POR QUÉ IMPORTA

Hace evaluables conjuntamente la calidad de respuesta y el número de búsquedas.

Ver problema que intenta resolver

Buscar siempre o nunca no respeta la incertidumbre ni el presupuesto de cada pregunta.

RAG, retrieval, decisión.QA documentalbúsqueda empresarial
24–30 AGOSTO 2026 · #05Imprescindible

The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success

Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu · 25 agosto 2026; versión v1.

IDEA CENTRAL

Separa éxito de recuperación, abstención, tarea y generación en 27 configuraciones con 10.000 consultas por condición.

POR QUÉ IMPORTA

Aporta una estructura de diagnóstico para políticas de evidencia y jueces.

Ver problema que intenta resolver

El score final no indica si el sistema no encontró, no supo responder o respondió cuando debía abstenerse.

RAG, abstención, evaluación.evaluación de RAGpolíticas de abstención
24–30 AGOSTO 2026 · #06Imprescindible

SPA: Secure Planning Agents with Information-Flow Control

Dylan Girrens y Guangjing Wang · 27 agosto 2026; versión v1.

IDEA CENTRAL

Un DSL declarativo y un control de flujo de información de doble retícula restringen los artefactos que pueden llegar a una acción.

POR QUÉ IMPORTA

Mide explícitamente el intercambio entre utilidad y seguridad en vez de esconderlo tras task success.

Ver problema que intenta resolver

Un agente puede completar una tarea mientras filtra información sensible.

seguridad, planificación, information-flow control.agentes segurosdatos sensibles
24–30 AGOSTO 2026 · #07Imprescindible

ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang et al. · 27 agosto 2026; versión v2.

IDEA CENTRAL

Separa selección de pistas e interpretación y conserva citas por identificador de párrafo.

POR QUÉ IMPORTA

Conecta precisión multi-hop con una trayectoria de evidencia auditable.

Ver problema que intenta resolver

Una cita válida puede ser decorativa si no sostiene cada salto del razonamiento.

RAG, evidencia, trazabilidad.investigación asistidadue diligence
24–30 AGOSTO 2026 · #08Interesante

TOPAS: Topology-Aware Scheduling for LLM Agent Workflows

Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan · 26 agosto 2026; versión v1.

IDEA CENTRAL

Usa la topología del workflow para programar solicitudes y reducir el tiempo de finalización del job.

POR QUÉ IMPORTA

Lleva la optimización del agente al scheduler y al grafo de ejecución.

Ver problema que intenta resolver

Servir llamadas como peticiones aisladas ignora dependencias y oportunidades de scheduling.

serving, workflows DAG, latencia.serving de agentesorquestadores LLM
24–30 AGOSTO 2026 · #09Interesante

ReWorld: An Interactive World Model with Long-Horizon Memory

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

POR QUÉ IMPORTA

Puede ampliar el radar de memoria ejecutable, pero aún no hay extracción primaria.

Ver problema que intenta resolver

Las tareas largas exigen conservar estado y volver a consultar el mundo.

memoria, world models.agentes personalessimulación
24–30 AGOSTO 2026 · #10Interesante

SWE Refactor Bench

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre evaluación de refactors de software por agentes.

POR QUÉ IMPORTA

Podría aportar una prueba más exigente de trabajo de ingeniería, pendiente de verificar.

Ver problema que intenta resolver

Los tests que pasan no siempre demuestran que una refactorización preserve arquitectura y comportamiento.

coding, evaluación.coding agentsrevisión de código
24–30 AGOSTO 2026 · #11Vigilar

On the Threat Model of Weird Generalization and Emergent Misalignment

Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre generalización extraña y desalineamiento emergente.

POR QUÉ IMPORTA

Es una posible pieza de threat modeling, pero no se publica como evidencia hasta leerla.

Ver problema que intenta resolver

La evaluación nominal puede no cubrir comportamientos que aparecen fuera de la distribución entrenada.

seguridad, alineamiento.red teamingevaluación de alineamiento
24–30 AGOSTO 2026 · #12Interesante

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

POR QUÉ IMPORTA

Puede conectar feedback y evolución de retrieval, pendiente de verificar método y resultados.

Ver problema que intenta resolver

Una señal de recompensa fija puede dejar de representar la calidad cuando cambia la política de búsqueda.

RAG, feedback, agentes.search agentsRAG
24–30 AGOSTO 2026 · #13Interesante

Evidence Blindness in Search Agents: AtlasNav

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.

POR QUÉ IMPORTA

Podría reforzar el eje de trazabilidad, pendiente de lectura y localizadores exactos.

Ver problema que intenta resolver

Navegar por documentos no garantiza que el agente haya identificado el pasaje que justifica su respuesta.

RAG, evidencia, navegación.búsqueda asistidaQA documental
24–30 AGOSTO 2026 · #14Interesante

StepGuard

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre compuertas de seguridad a nivel de paso.

POR QUÉ IMPORTA

Puede complementar el control de trayectoria, pendiente de confirmar alcance y coste.

Ver problema que intenta resolver

Una revisión al final del workflow puede llegar demasiado tarde para bloquear una acción peligrosa.

seguridad, verificación.guardrailsagentes con herramientas
24–30 AGOSTO 2026 · #15Vigilar

RACE

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.

POR QUÉ IMPORTA

Se conserva para no perder la señal, sin atribuirle claims no leídos.

Ver problema que intenta resolver

La etiqueta scout no permite todavía distinguir benchmark, método o protocolo.

agentes, evaluación.evaluación de agentesorquestación
24–30 AGOSTO 2026 · #16Interesante

Right Diagnoses, Decorative Reasoning

Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.

POR QUÉ IMPORTA

Puede reforzar la separación entre resultado y trayectoria, pendiente de evidencia primaria.

Ver problema que intenta resolver

Una explicación plausible puede no ser la causa real de una decisión correcta.

evaluación, razonamiento.evaluación de razonamientoauditoría
24–30 AGOSTO 2026 · #17Vigilar

AsymSpec

Autores pendientes de lectura primaria · 26 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.

POR QUÉ IMPORTA

Se mantiene como vigilancia hasta completar la lectura primaria.

Ver problema que intenta resolver

El nombre y el abstract scout no bastan para conocer tarea, baseline o resultado.

modelos, especulación.model servingeficiencia
24–30 AGOSTO 2026 · #18Interesante

When Tool Outputs Become Commands

Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

POR QUÉ IMPORTA

Es una señal de seguridad relevante para interfaces de herramientas, pendiente de método y resultados.

Ver problema que intenta resolver

Los datos devueltos por una herramienta pueden cruzar una frontera de autoridad si el agente los interpreta como comandos.

seguridad, tool use.tool securityprompt injection
24–30 AGOSTO 2026 · #19Interesante

WikiSkill

Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.

IDEA CENTRAL

Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.

POR QUÉ IMPORTA

Puede enlazar el radar de skills con evidencia y estado persistente, pendiente de verificación.

Ver problema que intenta resolver

Un skill reutilizable necesita procedencia, límites y una interfaz ejecutable, no sólo texto recuperado.

skills, agentes.skill librariesagentes de conocimiento
24–30 AGOSTO 2026 · #20Vigilar

AgentFold

Autores pendientes de lectura primaria · 27 agosto 2026; versión v2 28 agosto 2026.

IDEA CENTRAL

Señal del scout sobre composición o compactación de agentes.

POR QUÉ IMPORTA

Se conserva para la próxima lectura sin elevarla a evidencia.

Ver problema que intenta resolver

La señal inicial no permite aún saber si el aporte es de entrenamiento, serving o coordinación.

agentes, orquestación.orquestaciónmulti-agent systems
10–16 AGOSTO 2026 · #01Imprescindible

Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes

Chen Xu, Zitian Guo, Chenyan Xiong. · 11 agosto 2026.

IDEA CENTRAL

modela la relación entre creadores de contenido y motores generativos como un juego repetido. Los creadores optimizan sus páginas para conseguir citas, mientras la plataforma intenta preservar calidad y atribución. El paper muestra que las defensas convencionales pueden desencadenar una carrera adaptativa donde cada iteración de GEO introduce más afirmaciones no sustentadas. Propone VCR, Verifiable-Content Rewards, que premia contenido verificable en vez de limitarse a castigar manipulación.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

GEO puede evolucionar hacia algo parecido al spam SEO: todos optimizan para ser citados hasta degradar el ecosistema. Por qué puede ser importante: probablemente es el paper más estratégico de la semana para la economía de asistentes. Sugiere que ChatGPT/Google/Gemini-like systems necesitarán cambiar los incentivos de citación, no solamente sus filtros.

GEO, búsqueda generativa, discovery, seguridad económica.GEO/LLMOmotores de respuesta
10–16 AGOSTO 2026 · #02Imprescindible

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang; Purdue, Microsoft Research y University of Chicago. · 11 agosto 2026.

IDEA CENTRAL

mantiene prácticamente iguales las capacidades disponibles y cambia solo cómo se exponen las herramientas al agente. En 11.700 trayectorias y seis arquitecturas, demuestra que la interfaz altera significativamente comportamiento y coste. Interfaces estructuradas mejoran hasta 4,7× la consistencia; búsqueda en lenguaje natural aumenta >11% el acceso a archivos relevantes; CodeAct con Python logra rendimiento similar usando 41,6% menos pasos y 56,3% menos tokens.

POR QUÉ IMPORTA

confirma una tesis cada vez más fuerte: modelo + herramientas no basta; la arquitectura de interacción es una ventaja competitiva propia.

Ver problema que intenta resolver

solemos atribuir el éxito del agente al modelo aunque gran parte proceda de su API/harness.

agentes, coding agents, harness engineering.Codex-like agentsIDEs
10–16 AGOSTO 2026 · #03Imprescindible

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li. · 11 agosto 2026.

IDEA CENTRAL

usa un modelo fuerte como actor/crítico para producir skills en lenguaje natural específicamente adaptadas a modelos pequeños. Toda la señal de RL se propaga mediante lenguaje, sin modificar directamente el executor pequeño. En Qwen3.5-9B y 4B obtiene mejoras absolutas de hasta 20,4 y 13,3 puntos respectivamente; en SkillsBench, el 9B llega a igualar modelos cerrados fuertes en tareas single-skill.

POR QUÉ IMPORTA

abre una arquitectura económicamente potente: frontier model diseña skills → SLM barato ejecuta repetidamente.

Ver problema que intenta resolver

un skill escrito para un frontier model no necesariamente funciona bien con un SLM.

SLM, skills, agentes, RL.agentes localesautomatizaciones empresariales
10–16 AGOSTO 2026 · #04Imprescindible

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor. · 12 agosto 2026.

IDEA CENTRAL

benchmark con más de 8.000 APIs ejecutables en 62 dominios y tareas que combinan APIs, documentos y restricciones expresadas en lenguaje natural. Incluso el mejor modelo baja de 70,4% en tareas endpoint simples a \~50–51% en APIs composicionales; con más hops el rendimiento cae más del 50%. En preguntas imposibles bajo políticas de uso, algunos resultados bajan hasta 2,4%.

POR QUÉ IMPORTA

expone que el cuello de botella ya no es “saber llamar una API”, sino desambiguar entidades, combinar fuentes y respetar políticas.

Ver problema que intenta resolver

los benchmarks suelen evaluar tool-use y retrieval por separado, pero las empresas necesitan ambas capacidades simultáneamente.

agentes empresariales, APIs, RAG, evaluación.CRMERP
10–16 AGOSTO 2026 · #05Imprescindible

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li. · 12 agosto 2026.

IDEA CENTRAL

evita construir un knowledge graph global. Cada chunk se almacena como un evento semánticamente completo + sus entidades. En tiempo de consulta, SQL usa entidades compartidas como joins y construye dinámicamente un vecindario tipo hipergrafo. Así mantiene intactos los documentos originales y evita fragmentarlos en triples.

POR QUÉ IMPORTA

es extremadamente atractivo para conocimiento corporativo mutable. En MuSiQue alcanza 80,36% Recall\@5, 11,52 puntos sobre el mejor baseline comparado.

Ver problema que intenta resolver

GraphRAG aporta estructura, pero genera coste de construcción, mantenimiento y actualizaciones.

RAG, enterprise search, structured retrieval.documentación internaCRM
10–16 AGOSTO 2026 · #06Imprescindible

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng. · 10 agosto 2026.

IDEA CENTRAL

no intenta mejorar el skill, sino garantizar que el agente realmente siga el procedimiento. Construye una DSL de runtime guidance a partir del skill y de ejecuciones anteriores, monitoriza cada ejecución y actualiza esa guía usando nuevas trazas. Sobre 15 skills y agentes Claude Code/Codex con varios modelos aumenta de media el éxito un 24,1% y reduce variabilidad.

POR QUÉ IMPORTA

los skills empiezan a parecerse a procedimientos verificables, no simples prompts.

Ver problema que intenta resolver

disponer de una buena receta no garantiza que el LLM la siga consistentemente.

skills, reliability, agentes.SOPscoding agents
10–16 AGOSTO 2026 · #07Imprescindible

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu. · 10 agosto 2026.

IDEA CENTRAL

demuestra que un único skill puede esconder una regla maliciosa que permanece inactiva hasta detectar un trigger aparentemente inocuo dentro de la consulta. El ataque no necesita modificar pesos y mantiene comportamiento normal cuando no aparece el trigger. Los autores reportan alta tasa de ataque, falsos positivos cercanos a cero y transferencia entre cuatro familias de modelos.

POR QUÉ IMPORTA

un SKILL.md debe empezar a tratarse como tratamos una dependencia npm/pip: procedencia, permisos, sandbox y auditoría.

Ver problema que intenta resolver

los skills descargados se están convirtiendo en una nueva cadena de suministro de software.

agent safety, skills, supply-chain security.scanners de skillsmarketplaces seguros
10–16 AGOSTO 2026 · #08Imprescindible

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong; Ant International. · 12 agosto 2026.

IDEA CENTRAL

sostiene que “reflexiona e inténtalo otra vez” es demasiado genérico. Diferentes fallos requieren diferentes estrategias: error de acción, esquema inválido, evidencia insuficiente, ruta API incorrecta, etc. El sistema primero diagnostica la clase de error y solo entonces aplica el recovery correspondiente.

POR QUÉ IMPORTA

podría ser una pieza fundamental de agentes robustos: failure routing, equivalente a manejo de excepciones semántico.

Ver problema que intenta resolver

añadir más contexto o reflexión puede incluso empeorar una trayectoria si el mecanismo de recuperación no coincide con el error.

reasoning, agentes, self-correction.coding agentsRPA
10–16 AGOSTO 2026 · #09Imprescindible

MetaStrategy: Generative Ranking with Executable LLM Strategies

Chengyu Lai et al. · 10 agosto 2026.

IDEA CENTRAL

en vez de pedir al LLM que genere directamente el ranking, genera una estrategia estructurada en JSON: pesos de objetivos, preferencias, restricciones y políticas de posición. Un compilador determinista la aplica al ranking real. Además, destila profesores de 4B en un estudiante de 0,8B.

POR QUÉ IMPORTA

tiene una señal de adopción excepcional: se desplegó en Taobao. En un A/B test de siete días reporta +2,11% click PV, +3,12% item-detail PV y +2,83% transaction amount, sin añadir latencia observable al ranking síncrono.

Ver problema que intenta resolver

los rankings generativos end-to-end son difíciles de combinar con reglas de negocio, modelos existentes y guardrails.

recomendación, ranking, discovery, SLM.marketplacesfeeds
10–16 AGOSTO 2026 · #10Interesante

Test-Time Optimization of Query Embeddings with Ranking-Aware Reward Maximization

Tianyu Chen, Jiaxing Wu. · 12 agosto 2026.

IDEA CENTRAL

TTT-Embed aprende en tiempo de inferencia un pequeño vector en el espacio de embeddings usando únicamente scores de ranking de un reranker o LLM judge. No cambia el retriever ni el índice y funciona incluso con APIs cerradas. La política puede reutilizarse globalmente, por tarea o por query.

POR QUÉ IMPORTA

convierte la señal del reranker en memoria adaptativa del propio retrieval. Reporta hasta +8,36 nDCG\@10 y generalización a queries/tareas no vistas.

Ver problema que intenta resolver

los rerankers producen información valiosa pero normalmente se descarta después de cada consulta.

retrieval, embeddings, search.RAGenterprise search
10–16 AGOSTO 2026 · #11Interesante

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mengru Wang, Junfeng Fang, Shuofei Qiao et al.; Zhejiang University, NUS, UCSD y colaboradores. · 12 agosto 2026.

IDEA CENTRAL

automatiza investigación de interpretabilidad mediante un ciclo hipótesis → experimento → verificación → iteración. Combina un knowledge graph específico de interpretabilidad de \~13.000 papers con una base interdisciplinar de 43 millones de trabajos. Mantiene humanos definiendo objetivos y criterios científicos.

POR QUÉ IMPORTA

es un ejemplo fuerte de “AI scientist” con un dominio bien acotado y verificable, en vez de intentar automatizar toda la ciencia.

Ver problema que intenta resolver

la capacidad de los modelos evoluciona más rápido que nuestra capacidad de comprender sus mecanismos internos.

agentes científicos, interpretabilidad, reasoning.interpretabilidadred-teaming
10–16 AGOSTO 2026 · #12Interesante

MMDiff: Multimodal Model Diffing for Feature Discovery and Control

trabajo sobre LLaVA-MORE, PaliGemma 2 e InternVL3.5. · agosto 2026, dentro de la ventana de la semana.

IDEA CENTRAL

compara sparse autoencoders del backbone lingüístico y del modelo multimodal para identificar qué features internas fueron alteradas por el entrenamiento visual. Después usa esas features para controlar capacidades o seguridad. Eliminar ciertas direcciones reduce específicamente 12% las tareas espaciales, 17% OCR y 24% el éxito de ataques multimodales, sin perjudicar VQA general; steering también mejora tareas objetivo.

POR QUÉ IMPORTA

convierte interpretabilidad en un mecanismo de control causal, no únicamente visualización post-hoc.

Ver problema que intenta resolver

no sabemos qué parte del comportamiento de un MLLM apareció específicamente al añadir visión.

multimodalidad, interpretabilidad, safety.safety multimodalauditoría
10–16 AGOSTO 2026 · #13Interesante

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

Xiaohongshu Dots Studio, Evolvent AI. · 11 agosto 2026.

IDEA CENTRAL

evalúa agentes durante unas 30 jornadas simuladas y 24 etapas, incluyendo eventos que ocurren sin notificación. El agente tiene que volver a comprobar el mundo por iniciativa propia, mantener compromisos y recordar restricciones persistentes como pasaportes, trámites o riesgos de phishing.

POR QUÉ IMPORTA

introduce una dimensión poco evaluada: proactividad temporal. Un asistente personal útil no solo recuerda; debe saber cuándo volver a mirar.

Ver problema que intenta resolver

los benchmarks suelen esperar que el usuario desencadene cada acción; la vida real continúa aunque nadie escriba al agente.

memoria, agentes personales, evaluación long-horizon.asistentes familiaresviajes
10–16 AGOSTO 2026 · #14Vigilar

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim. · 12 agosto 2026.

IDEA CENTRAL

MBA-Bench contiene 30.000 muestras en seis dominios donde las ideas de negocio deben derivarse de señales visuales que el texto por sí solo no captura. El pipeline combina imagen, caption, queries extraídas visualmente y evidencia de mercado recuperada de la web.

POR QUÉ IMPORTA

abre un espacio interesante para agentes capaces de observar productos, espacios, comercios o procesos y conectarlos con información de mercado.

Ver problema que intenta resolver

la ideación empresarial agentic se evalúa casi siempre sobre texto, aunque las oportunidades del mundo físico son visuales.

multimodalidad, enterprise AI, agents.estudios de mercadoretail intelligence
3–9 AGOSTO 2026 · #01Imprescindible

CoEvo-Mem — Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li. · 3 agosto 2026.

IDEA CENTRAL

rompe una separación habitual: por un lado optimizamos cómo buscamos recuerdos y por otro cómo los almacenamos. CoEvo-Mem hace que retrieval y memoria evolucionen conjuntamente. Los resultados de las tareas actualizan tanto la política de routing como valores y relaciones del grafo de memoria; esos cambios modifican después qué recuerdos se recuperarán.

POR QUÉ IMPORTA

es probablemente la dirección conceptualmente más potente de la semana. Una memoria agentic madura no debería ser una base vectorial estática: debería aprender simultáneamente qué conservar, cómo relacionarlo, cuándo buscarlo y cuánto confiar en ello. Reporta SOTA en siete benchmarks.

Ver problema que intenta resolver

una memoria que cambia vuelve obsoleta la política de retrieval que fue diseñada para consultarla.

memoria, agentes, RAG.asistentes personales persistentesCRM
3–9 AGOSTO 2026 · #02Imprescindible

Agent Memory Distillation — Empowering Small LLM Agents with Hierarchical Teacher Memory

Taeil Kim, Kangsan Kim, Sung Ju Hwang. · 7 agosto 2026.

IDEA CENTRAL

un agente grande ejecuta correctamente tareas y convierte sus experiencias en tres tipos de memoria: Workflow, Subtask y Function. Un modelo pequeño de 4B–8B recibe estas memorias sin modificar sus pesos. La memoria de workflow se carga al comenzar; las instrucciones específicas de herramientas aparecen cuando se producen errores.

POR QUÉ IMPORTA

el resultado es especialmente atractivo económicamente. Usando GPT-5-mini como profesor, los pequeños mejoran de media +27,2 puntos porcentuales en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox. Los modelos de 4B son los que más se benefician.

Ver problema que intenta resolver

los SLM generan pocas trayectorias exitosas y, por tanto, tienen dificultades para construir por sí mismos una buena experiencia operacional.

SLM, memoria, agentes, tool-use.agentes locales baratoscopilotos especializados