NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 01 · 8–14 Junio 2026
8–14 JUNIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 8–14 junio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields

Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor. El resultado clave es duro: incluso los modelos más fuertes apenas superan el 30% de éxito en estos workflows. El paper identifica fallos como omisión de etapas, deriva de objetivo, propagación de errores y mala comprensión de software profesional. La pregunta de producto que queda abierta es: Medir si los agentes pueden hacer trabajo económico real, no solo mini-tareas de navegador.

02 / IMPRESCINDIBLE

Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization

MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario. La pregunta de producto que queda abierta es: Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.

03 / IMPRESCINDIBLE

FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories

Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries. La pregunta de producto que queda abierta es: En fábrica, la información crítica está repartida entre manuales, máquinas, software y procesos. RAG genérico no basta si no se evalúa por groundedness, trazabilidad y seguridad local.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    AGENTES · EVALUACIÓN · CODING

    Workflow-GYM

    Propone un benchmark para evaluar agentes que usan interfaces gráficas en tareas profesionales largas y de alto valor.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11042#S4.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    AGENTES · SEGURIDAD · MULTIMODAL

    Minim

    MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.13949#S5.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    RAG · EVALUACIÓN · SEGURIDAD

    FactoryLLM

    Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas.

    La sección Results and Evaluation informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.14119#S5.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    MEMORIA

    REAL

    Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento.

    La sección Experiments and Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10694#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    RAG · EVALUACIÓN · CODING

    ScoreGate

    Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.14269#S5.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    RAG · EVALUACIÓN · MULTIMODAL

    Earth-OneVision

    Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10819#S5.
    Interesanteneeds-reviewLeer ficha
  7. 07
    AGENTES · EVALUACIÓN · CODING

    Claw-SWE-Bench

    Benchmark para evaluar agentes generalistas de código bajo un protocolo comparable a SWE-bench.

    La sección 5 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12344#S5.
    Interesanteneeds-reviewLeer ficha
  8. 08
    AGENTES · EVALUACIÓN · SEGURIDAD

    MAStrike

    Red-teaming para sistemas multiagente jerárquicos.

    La sección 6 Experiments informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12918#S6.
    Interesanteneeds-reviewLeer ficha
  9. 09
    CODING

    CompRank

    Framework de reranking con LLMs que comprime tokens y evita scoring generativo.

    La sección 5 Analysis informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11700#S5.
    Interesanteneeds-reviewLeer ficha
  10. 10
    AGENTES · SEGURIDAD · MULTIMODAL

    IAPO

    Método RL para mejorar uso de herramientas en agentes multimodales pequeños.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.11652#S4.
    Vigilarneeds-reviewLeer ficha
  11. 11
    RAG · CODING

    Code Is More Than Text

    Propone estimar incertidumbre en generación de código con señales específicas de código: fragilidad token-level, gap intención-implementación y ejecutabilidad.

    La sección 4 Main Results informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.09577#S4.
    Interesanteneeds-reviewLeer ficha
  12. 12
    EVALUACIÓN

    Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

    Argumenta que muchos benchmarks castigan formato más que conocimiento.

    La sección 4 Experimental Evaluation of Soft-Prompt Tuning informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12117#S4.
    Vigilarneeds-reviewLeer ficha
  13. 13
    IA APLICADA · EVALUACIÓN

    Mind your key

    Estudia fugas de credenciales de APIs LLM en apps iOS.

    La sección 4. Major Findings informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.12212#S4.
    Imprescindibleneeds-reviewLeer ficha
  14. 14
    MODELOS PEQUEÑOS

    Atomic Intent Reasoning

    AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain.

    La sección 5. Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.10357#S5.
    Interesanteneeds-reviewLeer ficha
  15. 15
    RAG

    Report on CHIIR 2026 Workshop on Generative AI and Academic Search

    Reporte de workshop sobre cómo la IA generativa transforma la búsqueda académica: de recuperar documentos a resumir, recomendar, sintetizar y conversar.

    La sección 2 Workshop Topics informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.08936#S2.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic Tasks in Real-World Professional Fields y localizar su resultado principal en la fuente primaria.
  2. Contrastar Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain