24–30 AGOSTO 2026 · #01Imprescindible
MobilePA-Bench: Evaluating Mobile Personal Agents in Real-World Tasks
Yi Zhu, Xiongwei Wu, Qiyi Wang et al.; MAI Team · 24 agosto 2026; versión v2 25 agosto 2026.
IDEA CENTRALBenchmark de 1.705 tareas en 13 dominios y 212 herramientas que separa uso básico, colaboración de subagentes, memoria y skills.
POR QUÉ IMPORTAAporta una línea base más cercana al agente móvil de producto y permite fijar gates por capacidad.
Ver problema que intenta resolver
Un único score de éxito oculta si el agente falla por herramienta, memoria, colaboración o skill.
agentes móviles, tool use, memoria, evaluación.copilotos móvilesevaluación de agentes
24–30 AGOSTO 2026 · #02Imprescindible
OODA-Tool: Specialized OODA Loops for Tool-Using Agents
Rongfeng Guo, Yinxuan Huang, Yusen Wu et al. · 25 agosto 2026; versión v2 27 agosto 2026.
IDEA CENTRALEspecializa observar, orientar, decidir y actuar para mejorar el uso de herramientas en Qwen3 de 0,6B a 14B.
POR QUÉ IMPORTAConecta la arquitectura de decisión con una métrica explícita de latencia secuencial.
Ver problema que intenta resolver
Una política única mezcla fases y oculta dónde se pierde exactitud y cuánto cuesta cada llamada.
agentes, tool use, latencia.agentes con APIsorquestación multi-herramienta
24–30 AGOSTO 2026 · #03Imprescindible
AnTrap: A Comprehensive Benchmark for Anomaly Traps in GUI Agents
Guo Gan, Yilun Zhao, Cong Chen et al. · 25 agosto 2026; versión v1.
IDEA CENTRALEvalúa 236 tareas con anomalías de estado, pensamiento, acción y ronda en 16 modelos GUI.
POR QUÉ IMPORTAConvierte la degradación ante anomalías en un gate separado del éxito nominal.
Ver problema que intenta resolver
El éxito en una interfaz limpia no muestra cómo responde el agente a un cambio de estado o una instrucción engañosa.
agentes GUI, seguridad, robustez.testing de agentes GUIred teaming
24–30 AGOSTO 2026 · #04Imprescindible
MetaRAG: Meta-Reinforcement Learning for Adaptive Retrieval-Augmented Generation
Qiuyi Qi, Tian Liang, Jiamu Wang et al. · 25 agosto 2026; versión v1.
IDEA CENTRALAprende cuándo recuperar y verificar mediante una política adaptativa con Verify-first Action Generation e Internal Belief Probing.
POR QUÉ IMPORTAHace evaluables conjuntamente la calidad de respuesta y el número de búsquedas.
Ver problema que intenta resolver
Buscar siempre o nunca no respeta la incertidumbre ni el presupuesto de cada pregunta.
RAG, retrieval, decisión.QA documentalbúsqueda empresarial
24–30 AGOSTO 2026 · #05Imprescindible
The RAT: A Bayesian Model of Retrieval, Abstention, and Task Success
Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak y Jan Milan Deriu · 25 agosto 2026; versión v1.
IDEA CENTRALSepara éxito de recuperación, abstención, tarea y generación en 27 configuraciones con 10.000 consultas por condición.
POR QUÉ IMPORTAAporta una estructura de diagnóstico para políticas de evidencia y jueces.
Ver problema que intenta resolver
El score final no indica si el sistema no encontró, no supo responder o respondió cuando debía abstenerse.
RAG, abstención, evaluación.evaluación de RAGpolíticas de abstención
24–30 AGOSTO 2026 · #06Imprescindible
SPA: Secure Planning Agents with Information-Flow Control
Dylan Girrens y Guangjing Wang · 27 agosto 2026; versión v1.
IDEA CENTRALUn DSL declarativo y un control de flujo de información de doble retícula restringen los artefactos que pueden llegar a una acción.
POR QUÉ IMPORTAMide explícitamente el intercambio entre utilidad y seguridad en vez de esconderlo tras task success.
Ver problema que intenta resolver
Un agente puede completar una tarea mientras filtra información sensible.
seguridad, planificación, information-flow control.agentes segurosdatos sensibles
24–30 AGOSTO 2026 · #07Imprescindible
ClueWeaver: Evidence-Guided Multi-Hop Question Answering with Self-Calibration
Jihao Zhu, Zhiwei Yang, Wenxiao Zhang et al. · 27 agosto 2026; versión v2.
IDEA CENTRALSepara selección de pistas e interpretación y conserva citas por identificador de párrafo.
POR QUÉ IMPORTAConecta precisión multi-hop con una trayectoria de evidencia auditable.
Ver problema que intenta resolver
Una cita válida puede ser decorativa si no sostiene cada salto del razonamiento.
RAG, evidencia, trazabilidad.investigación asistidadue diligence
24–30 AGOSTO 2026 · #08Interesante
TOPAS: Topology-Aware Scheduling for LLM Agent Workflows
Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li y Haisheng Tan · 26 agosto 2026; versión v1.
IDEA CENTRALUsa la topología del workflow para programar solicitudes y reducir el tiempo de finalización del job.
POR QUÉ IMPORTALleva la optimización del agente al scheduler y al grafo de ejecución.
Ver problema que intenta resolver
Servir llamadas como peticiones aisladas ignora dependencias y oportunidades de scheduling.
serving, workflows DAG, latencia.serving de agentesorquestadores LLM
24–30 AGOSTO 2026 · #09Interesante
ReWorld: An Interactive World Model with Long-Horizon Memory
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre memoria de horizonte largo en un mundo interactivo.
POR QUÉ IMPORTAPuede ampliar el radar de memoria ejecutable, pero aún no hay extracción primaria.
Ver problema que intenta resolver
Las tareas largas exigen conservar estado y volver a consultar el mundo.
memoria, world models.agentes personalessimulación
24–30 AGOSTO 2026 · #10Interesante
SWE Refactor Bench
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre evaluación de refactors de software por agentes.
POR QUÉ IMPORTAPodría aportar una prueba más exigente de trabajo de ingeniería, pendiente de verificar.
Ver problema que intenta resolver
Los tests que pasan no siempre demuestran que una refactorización preserve arquitectura y comportamiento.
coding, evaluación.coding agentsrevisión de código
24–30 AGOSTO 2026 · #11Vigilar
On the Threat Model of Weird Generalization and Emergent Misalignment
Autores pendientes de lectura primaria · 24 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre generalización extraña y desalineamiento emergente.
POR QUÉ IMPORTAEs una posible pieza de threat modeling, pero no se publica como evidencia hasta leerla.
Ver problema que intenta resolver
La evaluación nominal puede no cubrir comportamientos que aparecen fuera de la distribución entrenada.
seguridad, alineamiento.red teamingevaluación de alineamiento
24–30 AGOSTO 2026 · #12Interesante
CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.
POR QUÉ IMPORTAPuede conectar feedback y evolución de retrieval, pendiente de verificar método y resultados.
Ver problema que intenta resolver
Una señal de recompensa fija puede dejar de representar la calidad cuando cambia la política de búsqueda.
RAG, feedback, agentes.search agentsRAG
24–30 AGOSTO 2026 · #13Interesante
Evidence Blindness in Search Agents: AtlasNav
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre ceguera a la evidencia en agentes de búsqueda.
POR QUÉ IMPORTAPodría reforzar el eje de trazabilidad, pendiente de lectura y localizadores exactos.
Ver problema que intenta resolver
Navegar por documentos no garantiza que el agente haya identificado el pasaje que justifica su respuesta.
RAG, evidencia, navegación.búsqueda asistidaQA documental
24–30 AGOSTO 2026 · #14Interesante
StepGuard
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre compuertas de seguridad a nivel de paso.
POR QUÉ IMPORTAPuede complementar el control de trayectoria, pendiente de confirmar alcance y coste.
Ver problema que intenta resolver
Una revisión al final del workflow puede llegar demasiado tarde para bloquear una acción peligrosa.
seguridad, verificación.guardrailsagentes con herramientas
24–30 AGOSTO 2026 · #15Vigilar
RACE
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.
POR QUÉ IMPORTASe conserva para no perder la señal, sin atribuirle claims no leídos.
Ver problema que intenta resolver
La etiqueta scout no permite todavía distinguir benchmark, método o protocolo.
agentes, evaluación.evaluación de agentesorquestación
24–30 AGOSTO 2026 · #16Interesante
Right Diagnoses, Decorative Reasoning
Autores pendientes de lectura primaria · 25 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.
POR QUÉ IMPORTAPuede reforzar la separación entre resultado y trayectoria, pendiente de evidencia primaria.
Ver problema que intenta resolver
Una explicación plausible puede no ser la causa real de una decisión correcta.
evaluación, razonamiento.evaluación de razonamientoauditoría
24–30 AGOSTO 2026 · #17Vigilar
AsymSpec
Autores pendientes de lectura primaria · 26 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre AsymSpec y una posible arquitectura asimétrica.
POR QUÉ IMPORTASe mantiene como vigilancia hasta completar la lectura primaria.
Ver problema que intenta resolver
El nombre y el abstract scout no bastan para conocer tarea, baseline o resultado.
modelos, especulación.model servingeficiencia
24–30 AGOSTO 2026 · #18Interesante
When Tool Outputs Become Commands
Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.
POR QUÉ IMPORTAEs una señal de seguridad relevante para interfaces de herramientas, pendiente de método y resultados.
Ver problema que intenta resolver
Los datos devueltos por una herramienta pueden cruzar una frontera de autoridad si el agente los interpreta como comandos.
seguridad, tool use.tool securityprompt injection
24–30 AGOSTO 2026 · #19Interesante
WikiSkill
Autores pendientes de lectura primaria · 27 agosto 2026; versión v1.
IDEA CENTRALSeñal del scout sobre skills derivadas de conocimiento estructurado o wikis.
POR QUÉ IMPORTAPuede enlazar el radar de skills con evidencia y estado persistente, pendiente de verificación.
Ver problema que intenta resolver
Un skill reutilizable necesita procedencia, límites y una interfaz ejecutable, no sólo texto recuperado.
skills, agentes.skill librariesagentes de conocimiento
24–30 AGOSTO 2026 · #20Vigilar
AgentFold
Autores pendientes de lectura primaria · 27 agosto 2026; versión v2 28 agosto 2026.
IDEA CENTRALSeñal del scout sobre composición o compactación de agentes.
POR QUÉ IMPORTASe conserva para la próxima lectura sin elevarla a evidencia.
Ver problema que intenta resolver
La señal inicial no permite aún saber si el aporte es de entrenamiento, serving o coordinación.
agentes, orquestación.orquestaciónmulti-agent systems
10–16 AGOSTO 2026 · #01Imprescindible
Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes
Chen Xu, Zitian Guo, Chenyan Xiong. · 11 agosto 2026.
IDEA CENTRALmodela la relación entre creadores de contenido y motores generativos como un juego repetido. Los creadores optimizan sus páginas para conseguir citas, mientras la plataforma intenta preservar calidad y atribución. El paper muestra que las defensas convencionales pueden desencadenar una carrera adaptativa donde cada iteración de GEO introduce más afirmaciones no sustentadas. Propone VCR, Verifiable-Content Rewards, que premia contenido verificable en vez de limitarse a castigar manipulación.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
GEO puede evolucionar hacia algo parecido al spam SEO: todos optimizan para ser citados hasta degradar el ecosistema. Por qué puede ser importante: probablemente es el paper más estratégico de la semana para la economía de asistentes. Sugiere que ChatGPT/Google/Gemini-like systems necesitarán cambiar los incentivos de citación, no solamente sus filtros.
GEO, búsqueda generativa, discovery, seguridad económica.GEO/LLMOmotores de respuesta
10–16 AGOSTO 2026 · #02Imprescindible
The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior
Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang; Purdue, Microsoft Research y University of Chicago. · 11 agosto 2026.
IDEA CENTRALmantiene prácticamente iguales las capacidades disponibles y cambia solo cómo se exponen las herramientas al agente. En 11.700 trayectorias y seis arquitecturas, demuestra que la interfaz altera significativamente comportamiento y coste. Interfaces estructuradas mejoran hasta 4,7× la consistencia; búsqueda en lenguaje natural aumenta >11% el acceso a archivos relevantes; CodeAct con Python logra rendimiento similar usando 41,6% menos pasos y 56,3% menos tokens.
POR QUÉ IMPORTAconfirma una tesis cada vez más fuerte: modelo + herramientas no basta; la arquitectura de interacción es una ventaja competitiva propia.
Ver problema que intenta resolver
solemos atribuir el éxito del agente al modelo aunque gran parte proceda de su API/harness.
agentes, coding agents, harness engineering.Codex-like agentsIDEs
10–16 AGOSTO 2026 · #04Imprescindible
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor. · 12 agosto 2026.
IDEA CENTRALbenchmark con más de 8.000 APIs ejecutables en 62 dominios y tareas que combinan APIs, documentos y restricciones expresadas en lenguaje natural. Incluso el mejor modelo baja de 70,4% en tareas endpoint simples a \~50–51% en APIs composicionales; con más hops el rendimiento cae más del 50%. En preguntas imposibles bajo políticas de uso, algunos resultados bajan hasta 2,4%.
POR QUÉ IMPORTAexpone que el cuello de botella ya no es “saber llamar una API”, sino desambiguar entidades, combinar fuentes y respetar políticas.
Ver problema que intenta resolver
los benchmarks suelen evaluar tool-use y retrieval por separado, pero las empresas necesitan ambas capacidades simultáneamente.
agentes empresariales, APIs, RAG, evaluación.CRMERP
10–16 AGOSTO 2026 · #05Imprescindible
SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges
Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li. · 12 agosto 2026.
IDEA CENTRALevita construir un knowledge graph global. Cada chunk se almacena como un evento semánticamente completo + sus entidades. En tiempo de consulta, SQL usa entidades compartidas como joins y construye dinámicamente un vecindario tipo hipergrafo. Así mantiene intactos los documentos originales y evita fragmentarlos en triples.
POR QUÉ IMPORTAes extremadamente atractivo para conocimiento corporativo mutable. En MuSiQue alcanza 80,36% Recall\@5, 11,52 puntos sobre el mejor baseline comparado.
Ver problema que intenta resolver
GraphRAG aporta estructura, pero genera coste de construcción, mantenimiento y actualizaciones.
RAG, enterprise search, structured retrieval.documentación internaCRM
10–16 AGOSTO 2026 · #06Imprescindible
SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
You Lu, Xinyu Huang, Bihuan Chen, Xin Peng. · 10 agosto 2026.
IDEA CENTRALno intenta mejorar el skill, sino garantizar que el agente realmente siga el procedimiento. Construye una DSL de runtime guidance a partir del skill y de ejecuciones anteriores, monitoriza cada ejecución y actualiza esa guía usando nuevas trazas. Sobre 15 skills y agentes Claude Code/Codex con varios modelos aumenta de media el éxito un 24,1% y reduce variabilidad.
POR QUÉ IMPORTAlos skills empiezan a parecerse a procedimientos verificables, no simples prompts.
Ver problema que intenta resolver
disponer de una buena receta no garantiza que el LLM la siga consistentemente.
skills, reliability, agentes.SOPscoding agents
10–16 AGOSTO 2026 · #07Imprescindible
ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills
Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu. · 10 agosto 2026.
IDEA CENTRALdemuestra que un único skill puede esconder una regla maliciosa que permanece inactiva hasta detectar un trigger aparentemente inocuo dentro de la consulta. El ataque no necesita modificar pesos y mantiene comportamiento normal cuando no aparece el trigger. Los autores reportan alta tasa de ataque, falsos positivos cercanos a cero y transferencia entre cuatro familias de modelos.
POR QUÉ IMPORTAun SKILL.md debe empezar a tratarse como tratamos una dependencia npm/pip: procedencia, permisos, sandbox y auditoría.
Ver problema que intenta resolver
los skills descargados se están convirtiendo en una nueva cadena de suministro de software.
agent safety, skills, supply-chain security.scanners de skillsmarketplaces seguros
10–16 AGOSTO 2026 · #08Imprescindible
Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction
Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong; Ant International. · 12 agosto 2026.
IDEA CENTRALsostiene que “reflexiona e inténtalo otra vez” es demasiado genérico. Diferentes fallos requieren diferentes estrategias: error de acción, esquema inválido, evidencia insuficiente, ruta API incorrecta, etc. El sistema primero diagnostica la clase de error y solo entonces aplica el recovery correspondiente.
POR QUÉ IMPORTApodría ser una pieza fundamental de agentes robustos: failure routing, equivalente a manejo de excepciones semántico.
Ver problema que intenta resolver
añadir más contexto o reflexión puede incluso empeorar una trayectoria si el mecanismo de recuperación no coincide con el error.
reasoning, agentes, self-correction.coding agentsRPA
10–16 AGOSTO 2026 · #09Imprescindible
MetaStrategy: Generative Ranking with Executable LLM Strategies
Chengyu Lai et al. · 10 agosto 2026.
IDEA CENTRALen vez de pedir al LLM que genere directamente el ranking, genera una estrategia estructurada en JSON: pesos de objetivos, preferencias, restricciones y políticas de posición. Un compilador determinista la aplica al ranking real. Además, destila profesores de 4B en un estudiante de 0,8B.
POR QUÉ IMPORTAtiene una señal de adopción excepcional: se desplegó en Taobao. En un A/B test de siete días reporta +2,11% click PV, +3,12% item-detail PV y +2,83% transaction amount, sin añadir latencia observable al ranking síncrono.
Ver problema que intenta resolver
los rankings generativos end-to-end son difíciles de combinar con reglas de negocio, modelos existentes y guardrails.
recomendación, ranking, discovery, SLM.marketplacesfeeds
10–16 AGOSTO 2026 · #10Interesante
Test-Time Optimization of Query Embeddings with Ranking-Aware Reward Maximization
Tianyu Chen, Jiaxing Wu. · 12 agosto 2026.
IDEA CENTRALTTT-Embed aprende en tiempo de inferencia un pequeño vector en el espacio de embeddings usando únicamente scores de ranking de un reranker o LLM judge. No cambia el retriever ni el índice y funciona incluso con APIs cerradas. La política puede reutilizarse globalmente, por tarea o por query.
POR QUÉ IMPORTAconvierte la señal del reranker en memoria adaptativa del propio retrieval. Reporta hasta +8,36 nDCG\@10 y generalización a queries/tareas no vistas.
Ver problema que intenta resolver
los rerankers producen información valiosa pero normalmente se descarta después de cada consulta.
retrieval, embeddings, search.RAGenterprise search
10–16 AGOSTO 2026 · #11Interesante
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Mengru Wang, Junfeng Fang, Shuofei Qiao et al.; Zhejiang University, NUS, UCSD y colaboradores. · 12 agosto 2026.
IDEA CENTRALautomatiza investigación de interpretabilidad mediante un ciclo hipótesis → experimento → verificación → iteración. Combina un knowledge graph específico de interpretabilidad de \~13.000 papers con una base interdisciplinar de 43 millones de trabajos. Mantiene humanos definiendo objetivos y criterios científicos.
POR QUÉ IMPORTAes un ejemplo fuerte de “AI scientist” con un dominio bien acotado y verificable, en vez de intentar automatizar toda la ciencia.
Ver problema que intenta resolver
la capacidad de los modelos evoluciona más rápido que nuestra capacidad de comprender sus mecanismos internos.
agentes científicos, interpretabilidad, reasoning.interpretabilidadred-teaming
10–16 AGOSTO 2026 · #12Interesante
MMDiff: Multimodal Model Diffing for Feature Discovery and Control
trabajo sobre LLaVA-MORE, PaliGemma 2 e InternVL3.5. · agosto 2026, dentro de la ventana de la semana.
IDEA CENTRALcompara sparse autoencoders del backbone lingüístico y del modelo multimodal para identificar qué features internas fueron alteradas por el entrenamiento visual. Después usa esas features para controlar capacidades o seguridad. Eliminar ciertas direcciones reduce específicamente 12% las tareas espaciales, 17% OCR y 24% el éxito de ataques multimodales, sin perjudicar VQA general; steering también mejora tareas objetivo.
POR QUÉ IMPORTAconvierte interpretabilidad en un mecanismo de control causal, no únicamente visualización post-hoc.
Ver problema que intenta resolver
no sabemos qué parte del comportamiento de un MLLM apareció específicamente al añadir visión.
multimodalidad, interpretabilidad, safety.safety multimodalauditoría
10–16 AGOSTO 2026 · #13Interesante
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
Xiaohongshu Dots Studio, Evolvent AI. · 11 agosto 2026.
IDEA CENTRALevalúa agentes durante unas 30 jornadas simuladas y 24 etapas, incluyendo eventos que ocurren sin notificación. El agente tiene que volver a comprobar el mundo por iniciativa propia, mantener compromisos y recordar restricciones persistentes como pasaportes, trámites o riesgos de phishing.
POR QUÉ IMPORTAintroduce una dimensión poco evaluada: proactividad temporal. Un asistente personal útil no solo recuerda; debe saber cuándo volver a mirar.
Ver problema que intenta resolver
los benchmarks suelen esperar que el usuario desencadene cada acción; la vida real continúa aunque nadie escriba al agente.
memoria, agentes personales, evaluación long-horizon.asistentes familiaresviajes
10–16 AGOSTO 2026 · #14Vigilar
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation
Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim. · 12 agosto 2026.
IDEA CENTRALMBA-Bench contiene 30.000 muestras en seis dominios donde las ideas de negocio deben derivarse de señales visuales que el texto por sí solo no captura. El pipeline combina imagen, caption, queries extraídas visualmente y evidencia de mercado recuperada de la web.
POR QUÉ IMPORTAabre un espacio interesante para agentes capaces de observar productos, espacios, comercios o procesos y conectarlos con información de mercado.
Ver problema que intenta resolver
la ideación empresarial agentic se evalúa casi siempre sobre texto, aunque las oportunidades del mundo físico son visuales.
multimodalidad, enterprise AI, agents.estudios de mercadoretail intelligence
3–9 AGOSTO 2026 · #01Imprescindible
CoEvo-Mem — Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li. · 3 agosto 2026.
IDEA CENTRALrompe una separación habitual: por un lado optimizamos cómo buscamos recuerdos y por otro cómo los almacenamos. CoEvo-Mem hace que retrieval y memoria evolucionen conjuntamente. Los resultados de las tareas actualizan tanto la política de routing como valores y relaciones del grafo de memoria; esos cambios modifican después qué recuerdos se recuperarán.
POR QUÉ IMPORTAes probablemente la dirección conceptualmente más potente de la semana. Una memoria agentic madura no debería ser una base vectorial estática: debería aprender simultáneamente qué conservar, cómo relacionarlo, cuándo buscarlo y cuánto confiar en ello. Reporta SOTA en siete benchmarks.
Ver problema que intenta resolver
una memoria que cambia vuelve obsoleta la política de retrieval que fue diseñada para consultarla.
memoria, agentes, RAG.asistentes personales persistentesCRM
3–9 AGOSTO 2026 · #02Imprescindible
Agent Memory Distillation — Empowering Small LLM Agents with Hierarchical Teacher Memory
Taeil Kim, Kangsan Kim, Sung Ju Hwang. · 7 agosto 2026.
IDEA CENTRALun agente grande ejecuta correctamente tareas y convierte sus experiencias en tres tipos de memoria: Workflow, Subtask y Function. Un modelo pequeño de 4B–8B recibe estas memorias sin modificar sus pesos. La memoria de workflow se carga al comenzar; las instrucciones específicas de herramientas aparecen cuando se producen errores.
POR QUÉ IMPORTAel resultado es especialmente atractivo económicamente. Usando GPT-5-mini como profesor, los pequeños mejoran de media +27,2 puntos porcentuales en AppWorld, +11,2 en BFCL V3 y +3,4 en ToolSandbox. Los modelos de 4B son los que más se benefician.
Ver problema que intenta resolver
los SLM generan pocas trayectorias exitosas y, por tanto, tienen dificultades para construir por sí mismos una buena experiencia operacional.
SLM, memoria, agentes, tool-use.agentes locales baratoscopilotos especializados