8–14 JUNIO 2026 · #01Imprescindible
Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields
Liya Zhu, Jingzhe Ding, Jian Zhang et al. · v1 9 junio 2026; v3 11 junio 2026.
IDEA CENTRALPropone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.
POR QUÉ IMPORTAEs una brújula para saber cuándo los agentes estarán listos para ERP, CRM, gestión documental, legal ops, software industrial o backoffice.
Ver problema que intenta resolver
Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
ÁREA NO INDICADAbenchmarking interno de agentesvalidación de automatizaciones
8–14 JUNIO 2026 · #02Imprescindible
Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization
Hexuan Yu, Chaoyu Zhang, Heng Jin, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou. · 11 junio 2026; aceptado en ICML 2026.
IDEA CENTRALMINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.
POR QUÉ IMPORTASi los agentes van a operar PCs reales, privacidad contextual y minimización local serán requisitos de producto, no extras.
Ver problema que intenta resolver
Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.
ÁREA NO INDICADAagentes de escritoriocopilotos empresariales
8–14 JUNIO 2026 · #03Imprescindible
FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories
Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman. · 12 junio 2026; IEEE INDIN 2026.
IDEA CENTRALPropone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.
POR QUÉ IMPORTAEs muy aplicable a mantenimiento, diagnóstico, operaciones y digitalización industrial. Para pymes industriales puede ser una plantilla de producto.
Ver problema que intenta resolver
En fábrica, la información crítica está repartida entre manuales, máquinas, software y procesos. RAG genérico no basta si no se evalúa por groundedness, trazabilidad y seguridad local.
ÁREA NO INDICADAasistentes de mantenimientobúsqueda técnica
8–14 JUNIO 2026 · #04Imprescindible
REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs
Keer Lu, Liwei Chen, Guoqing Jiang, Zhiheng Qin, Yunhuai Liu, Wentao Zhang. · 9 junio 2026.
IDEA CENTRALFramework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.
POR QUÉ IMPORTAMemoria + razonamiento es una de las piezas que convierte un chatbot en un sistema operativo personal/empresarial.
Ver problema que intenta resolver
La memoria persistente de asistentes suele ser frágil: recupera hechos sueltos, no relaciones dinámicas ni cambios temporales.
ÁREA NO INDICADACRM inteligenteasistentes personales
8–14 JUNIO 2026 · #05Imprescindible
ScoreGate: Adaptive Chunk Selection for Retrieval-Augmented Generation via Dual-Score Statistical Fusion
Karamvir Singh, Arvind Jain. · 12 junio 2026.
IDEA CENTRALSustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.
POR QUÉ IMPORTAEs una mejora práctica de coste/calidad para cualquier RAG empresarial.
Ver problema que intenta resolver
El top-K fijo mete ruido, aumenta coste y falla cuando la complejidad de la pregunta cambia.
ÁREA NO INDICADAchatbots documentalesbuscadores internos
8–14 JUNIO 2026 · #06Interesante
Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks
Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li. · 9 junio 2026.
IDEA CENTRALModelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.
POR QUÉ IMPORTASeñal fuerte de que modelos pequeños y especializados pueden superar a modelos grandes generalistas en dominios ricos en estructura física.
Ver problema que intenta resolver
Los modelos de visión-lenguaje para observación terrestre suelen estar fragmentados por sensor y tarea.
ÁREA NO INDICADAmonitorización agrícolariesgos climáticos
8–14 JUNIO 2026 · #07Interesante
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks
Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu et al. · 10 junio 2026.
IDEA CENTRALBenchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.
POR QUÉ IMPORTALa generación de código está migrando de “completar snippets” a “resolver issues enteras con herramientas”. Medir el harness será tan importante como medir el modelo.
Ver problema que intenta resolver
Los agentes generalistas no encajan bien en el contrato limpio de SWE-bench, lo que dificulta comparar su capacidad real de programar.
ÁREA NO INDICADAevaluación de Codex/Cursor/Devin-like agentsCI agentic
8–14 JUNIO 2026 · #08Interesante
MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems
Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li. · v1 11 junio 2026; v2 12 junio 2026.
IDEA CENTRALRed-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.
POR QUÉ IMPORTALas empresas están empezando a diseñar equipos de agentes, y esa arquitectura introduce superficies de ataque nuevas: colusión, escalada de privilegios, manipulación entre agentes.
Ver problema que intenta resolver
La seguridad de un sistema multiagente no es la suma de seguridades individuales; los ataques pueden coordinarse entre roles.
ÁREA NO INDICADAauditoría de sistemas multiagenteseguridad de workflows
8–14 JUNIO 2026 · #09Interesante
CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring
Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen. · 10 junio 2026.
IDEA CENTRALFramework de reranking con LLMs que comprime tokens y evita scoring generativo. En TREC-COVID mantiene estabilidad con listas de hasta 500 documentos, logrando speedups de 4,9x–9,5x frente a reranking listwise generativo.
POR QUÉ IMPORTALa batalla de RAG/AI search se está moviendo del embedding al reranking eficiente.
Ver problema que intenta resolver
El reranking con LLMs mejora relevancia, pero cuesta demasiado para listas largas.
ÁREA NO INDICADAbuscadores empresarialese-commerce
8–14 JUNIO 2026 · #10Vigilar
IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents
Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang. · 10 junio 2026.
IDEA CENTRALMétodo RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.
POR QUÉ IMPORTASi queremos agentes baratos/locales, el tool-use en modelos pequeños será clave.
Ver problema que intenta resolver
Los SLM multimodales tienen dificultades para aprender tool-use con recompensas escasas o trayectorias anotadas inexistentes.
ÁREA NO INDICADAagentes móvilesinspección visual
8–14 JUNIO 2026 · #11Interesante
Code Is More Than Text: Uncertainty Estimation for Code Generation
Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu. · 8 junio 2026.
IDEA CENTRALPropone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.
POR QUÉ IMPORTALa automatización de PRs necesita saber cuándo pedir revisión humana.
Ver problema que intenta resolver
Los métodos de incertidumbre de texto no capturan que una sola línea de código puede romper todo el programa.
ÁREA NO INDICADAagentes de programaciónrevisión automática
8–14 JUNIO 2026 · #12Vigilar
Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation
Selen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu. · 10 junio 2026.
IDEA CENTRALArgumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.
POR QUÉ IMPORTAPara startups, elegir modelo por benchmark bruto puede ser engañoso; conviene distinguir conocimiento, formato y post-training.
Ver problema que intenta resolver
Evaluaciones injustas entre modelos base y post-entrenados.
ÁREA NO INDICADAevaluación interna de LLMsselección de modelos
8–14 JUNIO 2026 · #13Imprescindible
Mind your key: An Empirical Study of LLM API Credential Leakage in iOS Apps
Pinran Gao, Lingxiang Wang, Ying Zhang, Fan Yang. · 10 junio 2026.
IDEA CENTRALEstudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.
POR QUÉ IMPORTAEs un aviso directo para cualquier pyme que meta OpenAI/Anthropic/Gemini en mobile o frontend sin arquitectura segura.
Ver problema que intenta resolver
Pone números a un riesgo muy práctico: integrar LLMs mal en apps móviles puede exponer costes y datos.
ÁREA NO INDICADAauditorías de seguridaddiseño backend proxy
8–14 JUNIO 2026 · #14Interesante
Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations
Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang. · 9 junio 2026; KDD 2026.
IDEA CENTRALAIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.
POR QUÉ IMPORTAMuestra un patrón estratégico: usar LLMs fuera de línea para crear activos semánticos reutilizables en sistemas de baja latencia.
Ver problema que intenta resolver
Meter LLMs directamente en recomendadores online es demasiado lento, pero su semántica es valiosa.
ÁREA NO INDICADAe-commercerecomendación de contenido-producto
8–14 JUNIO 2026 · #15Vigilar
Report on CHIIR 2026 Workshop on Generative AI and Academic Search
Yifan Liu, Jaime Arguello, Orland Hoeber, Chang Liu, Soo Young Rieh et al. · 8 junio 2026.
IDEA CENTRALReporte de workshop sobre cómo la IA generativa transforma la búsqueda académica: de recuperar documentos a resumir, recomendar, sintetizar y conversar. Destaca transparencia, credibilidad, integridad investigadora y search-as-learning.
POR QUÉ IMPORTAEs relevante para SEO generativo y descubrimiento dentro de asistentes: la visibilidad ya no depende solo del ranking, sino de ser citado, sintetizado y absorbido en respuestas.
Ver problema que intenta resolver
No propone un algoritmo nuevo, pero organiza el campo de búsqueda generativa aplicada a investigación.
ÁREA NO INDICADAbuscadores académicosasistentes de investigación