NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
8–14 JUNIO 2026 · #01Imprescindible

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields

Liya Zhu, Jingzhe Ding, Jian Zhang et al. · v1 9 junio 2026; v3 11 junio 2026.

IDEA CENTRAL

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional.

POR QUÉ IMPORTA

Es una brújula para saber cuándo los agentes estarán listos para ERP, CRM, gestión documental, legal ops, software industrial o backoffice.

Ver problema que intenta resolver

Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.

ÁREA NO INDICADAbenchmarking interno de agentesvalidación de automatizaciones
8–14 JUNIO 2026 · #02Imprescindible

Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization

Hexuan Yu, Chaoyu Zhang, Heng Jin, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou. · 11 junio 2026; aceptado en ICML 2026.

IDEA CENTRAL

MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.

POR QUÉ IMPORTA

Si los agentes van a operar PCs reales, privacidad contextual y minimización local serán requisitos de producto, no extras.

Ver problema que intenta resolver

Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.

ÁREA NO INDICADAagentes de escritoriocopilotos empresariales
8–14 JUNIO 2026 · #03Imprescindible

FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman. · 12 junio 2026; IEEE INDIN 2026.

IDEA CENTRAL

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.

POR QUÉ IMPORTA

Es muy aplicable a mantenimiento, diagnóstico, operaciones y digitalización industrial. Para pymes industriales puede ser una plantilla de producto.

Ver problema que intenta resolver

En fábrica, la información crítica está repartida entre manuales, máquinas, software y procesos. RAG genérico no basta si no se evalúa por groundedness, trazabilidad y seguridad local.

ÁREA NO INDICADAasistentes de mantenimientobúsqueda técnica
8–14 JUNIO 2026 · #04Imprescindible

REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs

Keer Lu, Liwei Chen, Guoqing Jiang, Zhiheng Qin, Yunhuai Liu, Wentao Zhang. · 9 junio 2026.

IDEA CENTRAL

Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.

POR QUÉ IMPORTA

Memoria + razonamiento es una de las piezas que convierte un chatbot en un sistema operativo personal/empresarial.

Ver problema que intenta resolver

La memoria persistente de asistentes suele ser frágil: recupera hechos sueltos, no relaciones dinámicas ni cambios temporales.

ÁREA NO INDICADACRM inteligenteasistentes personales
8–14 JUNIO 2026 · #05Imprescindible

ScoreGate: Adaptive Chunk Selection for Retrieval-Augmented Generation via Dual-Score Statistical Fusion

Karamvir Singh, Arvind Jain. · 12 junio 2026.

IDEA CENTRAL

Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.

POR QUÉ IMPORTA

Es una mejora práctica de coste/calidad para cualquier RAG empresarial.

Ver problema que intenta resolver

El top-K fijo mete ruido, aumenta coste y falla cuando la complejidad de la pregunta cambia.

ÁREA NO INDICADAchatbots documentalesbuscadores internos
8–14 JUNIO 2026 · #06Interesante

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li. · 9 junio 2026.

IDEA CENTRAL

Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.

POR QUÉ IMPORTA

Señal fuerte de que modelos pequeños y especializados pueden superar a modelos grandes generalistas en dominios ricos en estructura física.

Ver problema que intenta resolver

Los modelos de visión-lenguaje para observación terrestre suelen estar fragmentados por sensor y tarea.

ÁREA NO INDICADAmonitorización agrícolariesgos climáticos
8–14 JUNIO 2026 · #07Interesante

Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu et al. · 10 junio 2026.

IDEA CENTRAL

Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench. Incluye 350 instancias de resolución de issues en 8 lenguajes y 43 repositorios, con contrato de workspace, presupuesto de ejecución, extracción de patches y evaluador común.

POR QUÉ IMPORTA

La generación de código está migrando de “completar snippets” a “resolver issues enteras con herramientas”. Medir el harness será tan importante como medir el modelo.

Ver problema que intenta resolver

Los agentes generalistas no encajan bien en el contrato limpio de SWE-bench, lo que dificulta comparar su capacidad real de programar.

ÁREA NO INDICADAevaluación de Codex/Cursor/Devin-like agentsCI agentic
8–14 JUNIO 2026 · #08Interesante

MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li. · v1 11 junio 2026; v2 12 junio 2026.

IDEA CENTRAL

Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.

POR QUÉ IMPORTA

Las empresas están empezando a diseñar equipos de agentes, y esa arquitectura introduce superficies de ataque nuevas: colusión, escalada de privilegios, manipulación entre agentes.

Ver problema que intenta resolver

La seguridad de un sistema multiagente no es la suma de seguridades individuales; los ataques pueden coordinarse entre roles.

ÁREA NO INDICADAauditoría de sistemas multiagenteseguridad de workflows
8–14 JUNIO 2026 · #09Interesante

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen. · 10 junio 2026.

IDEA CENTRAL

Framework de reranking con LLMs que comprime tokens y evita scoring generativo. En TREC-COVID mantiene estabilidad con listas de hasta 500 documentos, logrando speedups de 4,9x–9,5x frente a reranking listwise generativo.

POR QUÉ IMPORTA

La batalla de RAG/AI search se está moviendo del embedding al reranking eficiente.

Ver problema que intenta resolver

El reranking con LLMs mejora relevancia, pero cuesta demasiado para listas largas.

ÁREA NO INDICADAbuscadores empresarialese-commerce
8–14 JUNIO 2026 · #10Vigilar

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang. · 10 junio 2026.

IDEA CENTRAL

Método RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.

POR QUÉ IMPORTA

Si queremos agentes baratos/locales, el tool-use en modelos pequeños será clave.

Ver problema que intenta resolver

Los SLM multimodales tienen dificultades para aprender tool-use con recompensas escasas o trayectorias anotadas inexistentes.

ÁREA NO INDICADAagentes móvilesinspección visual
8–14 JUNIO 2026 · #11Interesante

Code Is More Than Text: Uncertainty Estimation for Code Generation

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu. · 8 junio 2026.

IDEA CENTRAL

Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad. Su ensemble de tres ejes sube AUROC de 0,696 a 0,776 frente al mejor baseline heredado de lenguaje natural.

POR QUÉ IMPORTA

La automatización de PRs necesita saber cuándo pedir revisión humana.

Ver problema que intenta resolver

Los métodos de incertidumbre de texto no capturan que una sola línea de código puede romper todo el programa.

ÁREA NO INDICADAagentes de programaciónrevisión automática
8–14 JUNIO 2026 · #12Vigilar

Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

Selen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu. · 10 junio 2026.

IDEA CENTRAL

Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.

POR QUÉ IMPORTA

Para startups, elegir modelo por benchmark bruto puede ser engañoso; conviene distinguir conocimiento, formato y post-training.

Ver problema que intenta resolver

Evaluaciones injustas entre modelos base y post-entrenados.

ÁREA NO INDICADAevaluación interna de LLMsselección de modelos
8–14 JUNIO 2026 · #13Imprescindible

Mind your key: An Empirical Study of LLM API Credential Leakage in iOS Apps

Pinran Gao, Lingxiang Wang, Ying Zhang, Fan Yang. · 10 junio 2026.

IDEA CENTRAL

Estudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.

POR QUÉ IMPORTA

Es un aviso directo para cualquier pyme que meta OpenAI/Anthropic/Gemini en mobile o frontend sin arquitectura segura.

Ver problema que intenta resolver

Pone números a un riesgo muy práctico: integrar LLMs mal en apps móviles puede exponer costes y datos.

ÁREA NO INDICADAauditorías de seguridaddiseño backend proxy
8–14 JUNIO 2026 · #14Interesante

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang. · 9 junio 2026; KDD 2026.

IDEA CENTRAL

AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.

POR QUÉ IMPORTA

Muestra un patrón estratégico: usar LLMs fuera de línea para crear activos semánticos reutilizables en sistemas de baja latencia.

Ver problema que intenta resolver

Meter LLMs directamente en recomendadores online es demasiado lento, pero su semántica es valiosa.

ÁREA NO INDICADAe-commercerecomendación de contenido-producto