15–21 JUNIO 2026 · #01Imprescindible
ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?
Jiajun Li, Mingshu Cai, Yixuan Li, Yu Ding, Ran Hou, Guanyu Nie, Xiongwei Han, Wanyuan Wang; Southeast University, Waseda, NTU, Huawei Noah’s Ark Lab. · 18 junio 2026.
IDEA CENTRALBenchmark ejecutable para evaluar agentes en tareas reales de investigación operativa: briefs en lenguaje natural, datos multiarchivo, configuraciones y un esquema de entrega validable.
POR QUÉ IMPORTAAcerca la evaluación de agentes a planificación, logística, asignación de recursos y optimización empresarial.
Ver problema que intenta resolver
Los benchmarks OR suelen separar modelado y resolución; aquí se mide el flujo completo.
ÁREA NO INDICADAsupply chainplanificación de turnos
15–21 JUNIO 2026 · #02Imprescindible
Multi-Agent Transactive Memory
To Eun Kim, Xuhong He, Dishank Jain, Ambuj Agrawal, Negar Arabzadeh, Fernando Diaz; CMU y UC Berkeley. · 18 junio 2026.
IDEA CENTRALPropone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.
POR QUÉ IMPORTAConvierte la experiencia de agentes en infraestructura colectiva, una especie de “buscador de procedimientos” para ecosistemas agentic.
Ver problema que intenta resolver
Las trayectorias útiles de agentes suelen descartarse tras una ejecución.
ÁREA NO INDICADAagentes empresarialesautomatización de navegador
15–21 JUNIO 2026 · #03Imprescindible
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
Ruishan Fang, Siyuan Lu, Chenyi Zhuang, Tao Lin; Inclusion AI/Ant Group, Zhejiang University, Westlake University. · 17 junio 2026.
IDEA CENTRALGenera datos online para entrenamiento RL de agentes tool-use, identificando muestras cerca del límite de capacidad mediante varianza de recompensa.
POR QUÉ IMPORTASeñala una vía para entrenar agentes con muchos menos ejemplos; reporta rendimiento comparable a una tubería offline de 17K muestras usando unas 20 veces menos trayectorias.
Ver problema que intenta resolver
Los datasets estáticos se agotan rápido: dejan de aportar gradiente útil.
ÁREA NO INDICADAagentes con APIsasistentes de datos
15–21 JUNIO 2026 · #04Imprescindible
Deontic Policies for Runtime Governance of Agentic AI Systems
Anupam Joshi, Tim Finin, Karuna Pande Joshi, Lalana Kagal. · 17 junio 2026.
IDEA CENTRALMarco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.
POR QUÉ IMPORTALos agentes productivos necesitarán políticas vivas, auditables y aplicables durante la ejecución.
Ver problema que intenta resolver
Motores como XACML, Rego o Cedar cubren sobre todo permitir/prohibir, pero no toda la estructura normativa necesaria para agentes autónomos.
ÁREA NO INDICADAcompliance agenticseguridad corporativa
15–21 JUNIO 2026 · #05Imprescindible
Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining
Yuexing Hao, Xiaomin Li; MIT y Harvard. · 18 junio 2026.
IDEA CENTRALExtrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.
POR QUÉ IMPORTAPuede convertir sesiones de uso reales en manuales operativos reutilizables para agentes.
Ver problema que intenta resolver
Las skills explícitas hacen agentes más inspeccionables, pero escribirlas a mano no escala.
ÁREA NO INDICADAagentes de escritoriosoporte IT
15–21 JUNIO 2026 · #06Imprescindible
Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents
Dhaval C. Patel et al.; IBM y colaboradores. · 18 junio 2026.
IDEA CENTRALEvalúa si los benchmarks de agentes predicen desempeño fuera de la muestra, no solo rankings estáticos.
POR QUÉ IMPORTAPara elegir agentes en producción, la validez predictiva vale más que una puntuación vistosa.
Ver problema que intenta resolver
Los leaderboards pueden ordenar modelos sin decir si generalizan a tareas futuras o dominios reales.
ÁREA NO INDICADAevaluación internaprocurement de modelos
15–21 JUNIO 2026 · #07Interesante
Variable-Width Transformers
Zhaofeng Wu, Oliver Sieberling, Shawn Tan, Rameswar Panda, Yury Polyanskiy, Yoon Kim; MIT y colaboradores. · 16 junio 2026.
IDEA CENTRALExplora Transformers cuyo ancho varía por capa, en vez de mantener la misma dimensión en todo el modelo.
POR QUÉ IMPORTAPuede abrir una ruta simple para modelos más eficientes sin cambiar radicalmente el paradigma Transformer.
Ver problema que intenta resolver
La arquitectura estándar reparte parámetros y cómputo de forma uniforme aunque las capas no tengan la misma función.
ÁREA NO INDICADAentrenamiento eficienteinferencia barata
15–21 JUNIO 2026 · #08Interesante
Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients
Byung-Kwan Lee, Ximing Lu, Shizhe Diao, Minki Kang, Saurav Muralidharan, Karan Sapra, Andrew Tao, Pavlo Molchanov, Yejin Choi, Yu-Chiang Frank Wang, Ryo Hachiuma; NVIDIA y colaboradores. · 16 junio 2026.
IDEA CENTRALMantiene la respuesta de un profesor fuerte dentro del prompt, no dentro del gradiente, para evitar drift en RL/distillation.
POR QUÉ IMPORTAEs relevante para entrenar modelos pequeños con ayuda de modelos grandes sin contaminar la señal RL.
Ver problema que intenta resolver
Cuando todos los rollouts fallan, inyectar respuestas de profesor en el gradiente rompe supuestos on-policy.
ÁREA NO INDICADASLMsVLMs
15–21 JUNIO 2026 · #09Interesante
Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev. · 18 junio 2026.
IDEA CENTRALExtiende LiveCodeBench a 12 lenguajes de programación manteniendo controles de contaminación y protocolo de evaluación.
POR QUÉ IMPORTALos agentes de programación empresariales deben tocar Java, JS/TS, C#, Go, Rust, SQL y legacy, no solo Python.
Ver problema que intenta resolver
La evaluación de código centrada en Python no representa bien software real multilenguaje.
ÁREA NO INDICADAevaluación de copilotosagentes de PR
15–21 JUNIO 2026 · #10Interesante
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Baoliang Tian, Dingwen Zhang, Tao Wang, Kim-Hui Yap, Ziwei Liu. · 18 junio 2026.
IDEA CENTRALFramework agentic para razonamiento espacial continuo con herramientas jerárquicas y memoria temporal sobre imágenes multi-vista y vídeo.
POR QUÉ IMPORTAUne multimodalidad, memoria y tool-use para percepción situada.
Ver problema que intenta resolver
Muchos VLMs razonan sobre frames aislados, no sobre mundos 3D persistentes.
ÁREA NO INDICADArobóticainspección industrial
15–21 JUNIO 2026 · #11Interesante
Self-CTRL: Self-Consistency Training with Reinforcement Learning
Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas; MIT CSAIL. · 16 junio 2026.
IDEA CENTRALEntrena modelos para que sus autoexplicaciones sean consistentes con su comportamiento.
POR QUÉ IMPORTALa trazabilidad de comportamiento será crítica en agentes, compliance y modelos regulados.
Ver problema que intenta resolver
Un modelo que explica mal por qué actúa como actúa es difícil de auditar.
ÁREA NO INDICADAauditoríainterpretabilidad
15–21 JUNIO 2026 · #12Interesante
BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling
Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn, Stefan Telgmann, Jörn Plönnigs, Stefan Lüdtke, Christian Bartelt. · 18 junio 2026.
IDEA CENTRALBenchmark para edición de modelos BIM/IFC con instrucciones en lenguaje natural; contiene 324 tareas en 11 modelos reales y 36 escenas sintéticas.
POR QUÉ IMPORTAExcelente señal de verticalización: LLMs aplicados a formatos profesionales complejos.
Ver problema que intenta resolver
Muchos benchmarks CAD miden generación desde cero, no edición semántica de escenas existentes.
ÁREA NO INDICADAarquitecturaingeniería
15–21 JUNIO 2026 · #13Vigilar
Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe
Qian Zhao et al.; Ant Group. · 18 junio 2026.
IDEA CENTRALAnaliza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.
POR QUÉ IMPORTASi funciona, baja costes de pretraining y acerca modelos grandes a más actores.
Ver problema que intenta resolver
FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.
ÁREA NO INDICADAentrenamiento LLMhardware-aware training
15–21 JUNIO 2026 · #14Vigilar
Structured Inference with Large Language Gibbs
Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer. · 17 junio 2026.
IDEA CENTRALExplora inferencia estructurada con un enfoque tipo Gibbs alrededor de LLMs.
POR QUÉ IMPORTAInteresante para neuro-simbólico, planificación e inferencia con restricciones.
Ver problema que intenta resolver
Los LLMs generan bien, pero controlar consistencia global y variables latentes sigue siendo difícil.
ÁREA NO INDICADArazonamiento estructuradoplanificación
15–21 JUNIO 2026 · #15Vigilar
CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models
Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang. · 18 junio 2026.
IDEA CENTRALFramework para evaluar conteo combinatorio en LLMs.
POR QUÉ IMPORTAConteo y combinatoria son base de planificación, análisis de casos, testing y optimización.
Ver problema que intenta resolver
Muchos modelos fallan en razonamiento discreto aunque acierten tareas lingüísticas.
ÁREA NO INDICADAevaluación de razonamientoQA técnico