NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
29 JUNIO–5 JULIO 2026 · #01Imprescindible

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng. · 2 julio 2026.

IDEA CENTRAL

Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local.

POR QUÉ IMPORTA

cambia el modelo mental: el LLM grande no responde cada llamada, sino que fabrica pequeñas funciones reutilizables.

Ver problema que intenta resolver

muchas funciones “difusas” —clasificar logs, reparar JSON, rankear por intención— se externalizan a APIs LLM caras y poco reproducibles.

ÁREA NO INDICADAautomatizaciones localesfunciones semánticas embebidas
29 JUNIO–5 JULIO 2026 · #02Imprescindible

Distributed Attacks in Persistent-State AI Control

Josh Hills, Ida Caspary, Asa Cooper Stickland. · 2 julio 2026.

IDEA CENTRAL

Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.

POR QUÉ IMPORTA

si los agentes empiezan a abrir PRs reales, el historial persistente es una superficie de ataque central.

Ver problema que intenta resolver

la seguridad de coding agents no puede evaluarse solo por diff aislado.

ÁREA NO INDICADArevisión de PRs agenticCI seguro
29 JUNIO–5 JULIO 2026 · #03Imprescindible

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard. · 30 junio 2026.

IDEA CENTRAL

Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.

POR QUÉ IMPORTA

apunta a agentes más baratos, más estables y con aprendizaje de trayectorias más fino.

Ver problema que intenta resolver

usar solo éxito/fallo final castiga exploración útil y premia pasos redundantes.

ÁREA NO INDICADAagentes webcompras
29 JUNIO–5 JULIO 2026 · #04Imprescindible

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He. · 2 julio 2026.

IDEA CENTRAL

Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.

POR QUÉ IMPORTA

muy aplicable a RAG largo, análisis documental y agentes con historial extenso.

Ver problema que intenta resolver

tener ventana larga no implica usar bien la evidencia.

ÁREA NO INDICADArevisión de contratosexpedientes
29 JUNIO–5 JULIO 2026 · #05Imprescindible

PACE: A Proxy for Agentic Capability Evaluation

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig. · 2 julio 2026.

IDEA CENTRAL

Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas. En 14 modelos, 4 benchmarks agentic y 19 no-agentic, logra MAE menor del 4%, Spearman >0.80 y ranking accuracy \~85% con menos del 1% del coste.

POR QUÉ IMPORTA

permite routing, selección de modelos y regresión continua sin pagar evaluaciones completas.

Ver problema que intenta resolver

evaluar SWE-Bench/GAIA cuesta días y miles de dólares.

ÁREA NO INDICADAselección de modelosCI de agentes
29 JUNIO–5 JULIO 2026 · #06Imprescindible

RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference

Wenhao Li, Jinhao Dong, Hailin Zhang, Wenhang Shi, Wei Lu, Xiaoyong Du. · 30 junio 2026; aceptado ICML 2026.

IDEA CENTRAL

Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.

POR QUÉ IMPORTA

long-context barato es base para agentes, RAG y memoria.

Ver problema que intenta resolver

el KV cache bloquea costes y latencia en contexto largo.

ÁREA NO INDICADAserving LLMasistentes documentales
29 JUNIO–5 JULIO 2026 · #07Interesante

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu/Yafu Li, Guanjie Chen, Derek F. Wong, Yu Cheng, Yang Yang. · 2 julio 2026.

IDEA CENTRAL

Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.

POR QUÉ IMPORTA

acerca la evaluación a agentes que iteran prompts, reglas, scripts o estrategias.

Ver problema que intenta resolver

muchos benchmarks no separan “saber resolver” de “saber mejorar una política”.

ÁREA NO INDICADAagentes autónomosoptimización de workflows
29 JUNIO–5 JULIO 2026 · #08Imprescindible

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy. · 2 julio 2026.

IDEA CENTRAL

Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.

POR QUÉ IMPORTA

clave para asistentes personales, CRM y productos con memoria.

Ver problema que intenta resolver

la personalización puede sesgar el razonamiento sin que la respuesta parezca mala.

ÁREA NO INDICADAauditoría de memoriapersonalización segura
29 JUNIO–5 JULIO 2026 · #09Interesante

AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation

Bao Long Nguyen Huu, Atsushi Hashimoto. · 30 junio 2026.

IDEA CENTRAL

Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.

POR QUÉ IMPORTA

graph-RAG empresarial necesita embeddings de grafos más útiles, no solo serializar nodos como texto.

Ver problema que intenta resolver

GraphRAG suele sufrir desalineación entre grafos y espacio textual de LLMs congelados.

ÁREA NO INDICADAknowledge graphsbúsqueda corporativa
29 JUNIO–5 JULIO 2026 · #10Interesante

DecompRL: Solving Harder Problems by Learning Modular Code Generation

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve. · 2 julio 2026.

IDEA CENTRAL

Entrena modelos a descomponer código en subfunciones recombinables. Recombinar k implementaciones de n módulos genera hasta k^n soluciones candidatas, desplazando coste de GPU a evaluación CPU y reduciendo coste de tokens \~50x.

POR QUÉ IMPORTA

propone una vía práctica para que modelos pequeños resuelvan problemas de programación más difíciles.

Ver problema que intenta resolver

si la política base casi nunca genera la solución completa, ni sampling ni RL estándar bastan.

ÁREA NO INDICADAcoding agentsgeneración de tests
29 JUNIO–5 JULIO 2026 · #11Interesante

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang. · 2 julio 2026.

IDEA CENTRAL

Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.

POR QUÉ IMPORTA

buen laboratorio para estudiar qué memoria ayuda realmente en decisiones prolongadas.

Ver problema que intenta resolver

los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.

ÁREA NO INDICADAdiseño de memoriaagentes estratégicos
29 JUNIO–5 JULIO 2026 · #12Interesante

UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development

Temitayo Olamilekan Ogunsusi, Lijun Qian, Xishuang Dong. · 2 julio 2026.

IDEA CENTRAL

Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase. Mejora completitud, ejecutabilidad, consistencia y calidad en SRDD.

POR QUÉ IMPORTA

los equipos de agentes necesitan control de confianza entre roles.

Ver problema que intenta resolver

errores tempranos se propagan entre agentes como si todos los outputs fueran fiables.

ÁREA NO INDICADAagentes de softwaregeneración de requisitos
29 JUNIO–5 JULIO 2026 · #13Interesante

Online Safety Monitoring for LLMs

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick. · 2 julio 2026; ICML 2026 Hypothesis Testing Workshop.

IDEA CENTRAL

Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo. En razonamiento matemático y red-teaming, un diseño simple compite con monitores de hypothesis testing secuencial.

POR QUÉ IMPORTA

producto real necesita alarmas calibradas, no filtros opacos.

Ver problema que intenta resolver

la seguridad debe medirse durante despliegue, no solo en evaluación offline.

ÁREA NO INDICADAsafety layermonitorización de chatbots
29 JUNIO–5 JULIO 2026 · #14Vigilar

A²utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho. · 2 julio 2026.

IDEA CENTRAL

Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.

POR QUÉ IMPORTA

evaluación generativa resistente a leakage es muy útil para medir razonamiento operativo.

Ver problema que intenta resolver

datasets fijos de word problems se contaminan y no escalan.

ÁREA NO INDICADAoptimizaciónagentes OR
29 JUNIO–5 JULIO 2026 · #15Vigilar

Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages

A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani. · 2 julio 2026.

IDEA CENTRAL

Revisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso. De 650 papers que mencionan LLM-as-a-Judge, solo 33 se centran en estos escenarios; detecta sobreconfianza, resultados inconsistentes y uso habitual de un solo juez.

POR QUÉ IMPORTA

afecta a productos europeos/multilingües y evaluación en español, catalán, euskera, árabe, lenguas africanas, etc.

Ver problema que intenta resolver

se está usando evaluación automática en idiomas donde el juez puede no ser competente.

ÁREA NO INDICADAQA multilingüeevaluación de chatbots