NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
15–21 JUNIO 2026 · #01Imprescindible

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

Jiajun Li, Mingshu Cai, Yixuan Li, Yu Ding, Ran Hou, Guanyu Nie, Xiongwei Han, Wanyuan Wang; Southeast University, Waseda, NTU, Huawei Noah’s Ark Lab. · 18 junio 2026.

IDEA CENTRAL

Benchmark ejecutable para evaluar agentes en tareas reales de investigación operativa: briefs en lenguaje natural, datos multiarchivo, configuraciones y un esquema de entrega validable.

POR QUÉ IMPORTA

Acerca la evaluación de agentes a planificación, logística, asignación de recursos y optimización empresarial.

Ver problema que intenta resolver

Los benchmarks OR suelen separar modelado y resolución; aquí se mide el flujo completo.

ÁREA NO INDICADAsupply chainplanificación de turnos
15–21 JUNIO 2026 · #02Imprescindible

Multi-Agent Transactive Memory

To Eun Kim, Xuhong He, Dishank Jain, Ambuj Agrawal, Negar Arabzadeh, Fernando Diaz; CMU y UC Berkeley. · 18 junio 2026.

IDEA CENTRAL

Propone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.

POR QUÉ IMPORTA

Convierte la experiencia de agentes en infraestructura colectiva, una especie de “buscador de procedimientos” para ecosistemas agentic.

Ver problema que intenta resolver

Las trayectorias útiles de agentes suelen descartarse tras una ejecución.

ÁREA NO INDICADAagentes empresarialesautomatización de navegador
15–21 JUNIO 2026 · #03Imprescindible

RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

Ruishan Fang, Siyuan Lu, Chenyi Zhuang, Tao Lin; Inclusion AI/Ant Group, Zhejiang University, Westlake University. · 17 junio 2026.

IDEA CENTRAL

Genera datos online para entrenamiento RL de agentes tool-use, identificando muestras cerca del límite de capacidad mediante varianza de recompensa.

POR QUÉ IMPORTA

Señala una vía para entrenar agentes con muchos menos ejemplos; reporta rendimiento comparable a una tubería offline de 17K muestras usando unas 20 veces menos trayectorias.

Ver problema que intenta resolver

Los datasets estáticos se agotan rápido: dejan de aportar gradiente útil.

ÁREA NO INDICADAagentes con APIsasistentes de datos
15–21 JUNIO 2026 · #04Imprescindible

Deontic Policies for Runtime Governance of Agentic AI Systems

Anupam Joshi, Tim Finin, Karuna Pande Joshi, Lalana Kagal. · 17 junio 2026.

IDEA CENTRAL

Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.

POR QUÉ IMPORTA

Los agentes productivos necesitarán políticas vivas, auditables y aplicables durante la ejecución.

Ver problema que intenta resolver

Motores como XACML, Rego o Cedar cubren sobre todo permitir/prohibir, pero no toda la estructura normativa necesaria para agentes autónomos.

ÁREA NO INDICADAcompliance agenticseguridad corporativa
15–21 JUNIO 2026 · #05Imprescindible

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

Yuexing Hao, Xiaomin Li; MIT y Harvard. · 18 junio 2026.

IDEA CENTRAL

Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.

POR QUÉ IMPORTA

Puede convertir sesiones de uso reales en manuales operativos reutilizables para agentes.

Ver problema que intenta resolver

Las skills explícitas hacen agentes más inspeccionables, pero escribirlas a mano no escala.

ÁREA NO INDICADAagentes de escritoriosoporte IT
15–21 JUNIO 2026 · #06Imprescindible

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

Dhaval C. Patel et al.; IBM y colaboradores. · 18 junio 2026.

IDEA CENTRAL

Evalúa si los benchmarks de agentes predicen desempeño fuera de la muestra, no solo rankings estáticos.

POR QUÉ IMPORTA

Para elegir agentes en producción, la validez predictiva vale más que una puntuación vistosa.

Ver problema que intenta resolver

Los leaderboards pueden ordenar modelos sin decir si generalizan a tareas futuras o dominios reales.

ÁREA NO INDICADAevaluación internaprocurement de modelos
15–21 JUNIO 2026 · #07Interesante

Variable-Width Transformers

Zhaofeng Wu, Oliver Sieberling, Shawn Tan, Rameswar Panda, Yury Polyanskiy, Yoon Kim; MIT y colaboradores. · 16 junio 2026.

IDEA CENTRAL

Explora Transformers cuyo ancho varía por capa, en vez de mantener la misma dimensión en todo el modelo.

POR QUÉ IMPORTA

Puede abrir una ruta simple para modelos más eficientes sin cambiar radicalmente el paradigma Transformer.

Ver problema que intenta resolver

La arquitectura estándar reparte parámetros y cómputo de forma uniforme aunque las capas no tengan la misma función.

ÁREA NO INDICADAentrenamiento eficienteinferencia barata
15–21 JUNIO 2026 · #08Interesante

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

Byung-Kwan Lee, Ximing Lu, Shizhe Diao, Minki Kang, Saurav Muralidharan, Karan Sapra, Andrew Tao, Pavlo Molchanov, Yejin Choi, Yu-Chiang Frank Wang, Ryo Hachiuma; NVIDIA y colaboradores. · 16 junio 2026.

IDEA CENTRAL

Mantiene la respuesta de un profesor fuerte dentro del prompt, no dentro del gradiente, para evitar drift en RL/distillation.

POR QUÉ IMPORTA

Es relevante para entrenar modelos pequeños con ayuda de modelos grandes sin contaminar la señal RL.

Ver problema que intenta resolver

Cuando todos los rollouts fallan, inyectar respuestas de profesor en el gradiente rompe supuestos on-policy.

ÁREA NO INDICADASLMsVLMs
15–21 JUNIO 2026 · #09Interesante

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev. · 18 junio 2026.

IDEA CENTRAL

Extiende LiveCodeBench a 12 lenguajes de programación manteniendo controles de contaminación y protocolo de evaluación.

POR QUÉ IMPORTA

Los agentes de programación empresariales deben tocar Java, JS/TS, C#, Go, Rust, SQL y legacy, no solo Python.

Ver problema que intenta resolver

La evaluación de código centrada en Python no representa bien software real multilenguaje.

ÁREA NO INDICADAevaluación de copilotosagentes de PR
15–21 JUNIO 2026 · #10Interesante

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Baoliang Tian, Dingwen Zhang, Tao Wang, Kim-Hui Yap, Ziwei Liu. · 18 junio 2026.

IDEA CENTRAL

Framework agentic para razonamiento espacial continuo con herramientas jerárquicas y memoria temporal sobre imágenes multi-vista y vídeo.

POR QUÉ IMPORTA

Une multimodalidad, memoria y tool-use para percepción situada.

Ver problema que intenta resolver

Muchos VLMs razonan sobre frames aislados, no sobre mundos 3D persistentes.

ÁREA NO INDICADArobóticainspección industrial
15–21 JUNIO 2026 · #11Interesante

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas; MIT CSAIL. · 16 junio 2026.

IDEA CENTRAL

Entrena modelos para que sus autoexplicaciones sean consistentes con su comportamiento.

POR QUÉ IMPORTA

La trazabilidad de comportamiento será crítica en agentes, compliance y modelos regulados.

Ver problema que intenta resolver

Un modelo que explica mal por qué actúa como actúa es difícil de auditar.

ÁREA NO INDICADAauditoríainterpretabilidad
15–21 JUNIO 2026 · #12Interesante

BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling

Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn, Stefan Telgmann, Jörn Plönnigs, Stefan Lüdtke, Christian Bartelt. · 18 junio 2026.

IDEA CENTRAL

Benchmark para edición de modelos BIM/IFC con instrucciones en lenguaje natural; contiene 324 tareas en 11 modelos reales y 36 escenas sintéticas.

POR QUÉ IMPORTA

Excelente señal de verticalización: LLMs aplicados a formatos profesionales complejos.

Ver problema que intenta resolver

Muchos benchmarks CAD miden generación desde cero, no edición semántica de escenas existentes.

ÁREA NO INDICADAarquitecturaingeniería
15–21 JUNIO 2026 · #13Vigilar

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

Qian Zhao et al.; Ant Group. · 18 junio 2026.

IDEA CENTRAL

Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.

POR QUÉ IMPORTA

Si funciona, baja costes de pretraining y acerca modelos grandes a más actores.

Ver problema que intenta resolver

FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.

ÁREA NO INDICADAentrenamiento LLMhardware-aware training
15–21 JUNIO 2026 · #14Vigilar

Structured Inference with Large Language Gibbs

Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer. · 17 junio 2026.

IDEA CENTRAL

Explora inferencia estructurada con un enfoque tipo Gibbs alrededor de LLMs.

POR QUÉ IMPORTA

Interesante para neuro-simbólico, planificación e inferencia con restricciones.

Ver problema que intenta resolver

Los LLMs generan bien, pero controlar consistencia global y variables latentes sigue siendo difícil.

ÁREA NO INDICADArazonamiento estructuradoplanificación
15–21 JUNIO 2026 · #15Vigilar

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang. · 18 junio 2026.

IDEA CENTRAL

Framework para evaluar conteo combinatorio en LLMs.

POR QUÉ IMPORTA

Conteo y combinatoria son base de planificación, análisis de casos, testing y optimización.

Ver problema que intenta resolver

Muchos modelos fallan en razonamiento discreto aunque acierten tareas lingüísticas.

ÁREA NO INDICADAevaluación de razonamientoQA técnico