29 JUNIO–5 JULIO 2026 · #01Imprescindible
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng. · 2 julio 2026.
IDEA CENTRALPropone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local.
POR QUÉ IMPORTAcambia el modelo mental: el LLM grande no responde cada llamada, sino que fabrica pequeñas funciones reutilizables.
Ver problema que intenta resolver
muchas funciones “difusas” —clasificar logs, reparar JSON, rankear por intención— se externalizan a APIs LLM caras y poco reproducibles.
ÁREA NO INDICADAautomatizaciones localesfunciones semánticas embebidas
29 JUNIO–5 JULIO 2026 · #02Imprescindible
Distributed Attacks in Persistent-State AI Control
Josh Hills, Ida Caspary, Asa Cooper Stickland. · 2 julio 2026.
IDEA CENTRALEstudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.
POR QUÉ IMPORTAsi los agentes empiezan a abrir PRs reales, el historial persistente es una superficie de ataque central.
Ver problema que intenta resolver
la seguridad de coding agents no puede evaluarse solo por diff aislado.
ÁREA NO INDICADArevisión de PRs agenticCI seguro
29 JUNIO–5 JULIO 2026 · #03Imprescindible
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard. · 30 junio 2026.
IDEA CENTRALMejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.
POR QUÉ IMPORTAapunta a agentes más baratos, más estables y con aprendizaje de trayectorias más fino.
Ver problema que intenta resolver
usar solo éxito/fallo final castiga exploración útil y premia pasos redundantes.
ÁREA NO INDICADAagentes webcompras
29 JUNIO–5 JULIO 2026 · #04Imprescindible
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He. · 2 julio 2026.
IDEA CENTRALMétodo training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.
POR QUÉ IMPORTAmuy aplicable a RAG largo, análisis documental y agentes con historial extenso.
Ver problema que intenta resolver
tener ventana larga no implica usar bien la evidencia.
ÁREA NO INDICADArevisión de contratosexpedientes
29 JUNIO–5 JULIO 2026 · #05Imprescindible
PACE: A Proxy for Agentic Capability Evaluation
Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig. · 2 julio 2026.
IDEA CENTRALPredice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas. En 14 modelos, 4 benchmarks agentic y 19 no-agentic, logra MAE menor del 4%, Spearman >0.80 y ranking accuracy \~85% con menos del 1% del coste.
POR QUÉ IMPORTApermite routing, selección de modelos y regresión continua sin pagar evaluaciones completas.
Ver problema que intenta resolver
evaluar SWE-Bench/GAIA cuesta días y miles de dólares.
ÁREA NO INDICADAselección de modelosCI de agentes
29 JUNIO–5 JULIO 2026 · #06Imprescindible
RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference
Wenhao Li, Jinhao Dong, Hailin Zhang, Wenhang Shi, Wei Lu, Xiaoyong Du. · 30 junio 2026; aceptado ICML 2026.
IDEA CENTRALFramework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.
POR QUÉ IMPORTAlong-context barato es base para agentes, RAG y memoria.
Ver problema que intenta resolver
el KV cache bloquea costes y latencia en contexto largo.
ÁREA NO INDICADAserving LLMasistentes documentales
29 JUNIO–5 JULIO 2026 · #07Interesante
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu/Yafu Li, Guanjie Chen, Derek F. Wong, Yu Cheng, Yang Yang. · 2 julio 2026.
IDEA CENTRALBenchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.
POR QUÉ IMPORTAacerca la evaluación a agentes que iteran prompts, reglas, scripts o estrategias.
Ver problema que intenta resolver
muchos benchmarks no separan “saber resolver” de “saber mejorar una política”.
ÁREA NO INDICADAagentes autónomosoptimización de workflows
29 JUNIO–5 JULIO 2026 · #08Imprescindible
DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models
Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy. · 2 julio 2026.
IDEA CENTRALMide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.
POR QUÉ IMPORTAclave para asistentes personales, CRM y productos con memoria.
Ver problema que intenta resolver
la personalización puede sesgar el razonamiento sin que la respuesta parezca mala.
ÁREA NO INDICADAauditoría de memoriapersonalización segura
29 JUNIO–5 JULIO 2026 · #09Interesante
AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation
Bao Long Nguyen Huu, Atsushi Hashimoto. · 30 junio 2026.
IDEA CENTRALMejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.
POR QUÉ IMPORTAgraph-RAG empresarial necesita embeddings de grafos más útiles, no solo serializar nodos como texto.
Ver problema que intenta resolver
GraphRAG suele sufrir desalineación entre grafos y espacio textual de LLMs congelados.
ÁREA NO INDICADAknowledge graphsbúsqueda corporativa
29 JUNIO–5 JULIO 2026 · #10Interesante
DecompRL: Solving Harder Problems by Learning Modular Code Generation
Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve. · 2 julio 2026.
IDEA CENTRALEntrena modelos a descomponer código en subfunciones recombinables. Recombinar k implementaciones de n módulos genera hasta k^n soluciones candidatas, desplazando coste de GPU a evaluación CPU y reduciendo coste de tokens \~50x.
POR QUÉ IMPORTApropone una vía práctica para que modelos pequeños resuelvan problemas de programación más difíciles.
Ver problema que intenta resolver
si la política base casi nunca genera la solución completa, ni sampling ni RL estándar bastan.
ÁREA NO INDICADAcoding agentsgeneración de tests
29 JUNIO–5 JULIO 2026 · #11Interesante
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang. · 2 julio 2026.
IDEA CENTRALTestbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.
POR QUÉ IMPORTAbuen laboratorio para estudiar qué memoria ayuda realmente en decisiones prolongadas.
Ver problema que intenta resolver
los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.
ÁREA NO INDICADAdiseño de memoriaagentes estratégicos
29 JUNIO–5 JULIO 2026 · #12Interesante
UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
Temitayo Olamilekan Ogunsusi, Lijun Qian, Xishuang Dong. · 2 julio 2026.
IDEA CENTRALFramework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.
POR QUÉ IMPORTAlos equipos de agentes necesitan control de confianza entre roles.
Ver problema que intenta resolver
errores tempranos se propagan entre agentes como si todos los outputs fueran fiables.
ÁREA NO INDICADAagentes de softwaregeneración de requisitos
29 JUNIO–5 JULIO 2026 · #13Interesante
Online Safety Monitoring for LLMs
Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick. · 2 julio 2026; ICML 2026 Hypothesis Testing Workshop.
IDEA CENTRALMonitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo. En razonamiento matemático y red-teaming, un diseño simple compite con monitores de hypothesis testing secuencial.
POR QUÉ IMPORTAproducto real necesita alarmas calibradas, no filtros opacos.
Ver problema que intenta resolver
la seguridad debe medirse durante despliegue, no solo en evaluación offline.
ÁREA NO INDICADAsafety layermonitorización de chatbots
29 JUNIO–5 JULIO 2026 · #14Vigilar
A²utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho. · 2 julio 2026.
IDEA CENTRALBenchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.
POR QUÉ IMPORTAevaluación generativa resistente a leakage es muy útil para medir razonamiento operativo.
Ver problema que intenta resolver
datasets fijos de word problems se contaminan y no escalan.
ÁREA NO INDICADAoptimizaciónagentes OR
29 JUNIO–5 JULIO 2026 · #15Vigilar
Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages
A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani. · 2 julio 2026.
IDEA CENTRALRevisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso. De 650 papers que mencionan LLM-as-a-Judge, solo 33 se centran en estos escenarios; detecta sobreconfianza, resultados inconsistentes y uso habitual de un solo juez.
POR QUÉ IMPORTAafecta a productos europeos/multilingües y evaluación en español, catalán, euskera, árabe, lenguas africanas, etc.
Ver problema que intenta resolver
se está usando evaluación automática en idiomas donde el juez puede no ser competente.
ÁREA NO INDICADAQA multilingüeevaluación de chatbots