Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields
Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional. La pregunta de producto que queda abierta es: Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.
Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization
MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario. La pregunta de producto que queda abierta es: Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.
FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories
Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries. La pregunta de producto que queda abierta es: En fábrica, la información crítica está repartida entre manuales, máquinas, software y procesos. RAG genérico no basta si no se evalúa por groundedness, trazabilidad y seguridad local.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
AGENTES · EVALUACIÓN · CODING
Workflow-GYM
Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11042#S4.
MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.13949#S5.
Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas.
La sección Results and Evaluation informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.14119#S5.
Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento.
La sección Experiments and Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10694#S4.
Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.14269#S5.
Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10819#S5.
Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench.
La sección 5 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12344#S5.
Red-teaming para sistemas multiagente jerárquicos.
La sección 6 Experiments informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12918#S6.
Framework de reranking con LLMs que comprime tokens y evita scoring generativo.
La sección 5 Analysis informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11700#S5.
Método RL para mejorar uso de herramientas en agentes multimodales pequeños.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11652#S4.
Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad.
La sección 4 Main Results informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.09577#S4.
Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation
Argumenta que muchos benchmarks castigan formato más que conocimiento.
La sección 4 Experimental Evaluation of Soft-Prompt Tuning informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12117#S4.
Estudia fugas de credenciales de APIs LLM en apps iOS.
La sección 4. Major Findings informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12212#S4.
AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain.
La sección 5. Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10357#S5.
Report on CHIIR 2026 Workshop on Generative AI and Academic Search
Reporte de workshop sobre cómo la IA generativa transforma la búsqueda académica: de recuperar documentos a resumir, recomendar, sintetizar y conversar.
La sección 2 Workshop Topics informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.08936#S2.
Abrir Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields y localizar su resultado principal en la fuente primaria.
Contrastar Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR
La señal también tiene sombra.
Una ficha abierta no equivale a una recomendación de adopción.
Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.