NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
22–28 JUNIO 2026 · #01Imprescindible

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

Vedant Patel. · 25 junio 2026.

IDEA CENTRAL

Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded.

POR QUÉ IMPORTA

esto es clave para asistentes personales, CRM y agentes empresariales reales.

Ver problema que intenta resolver

memoria persistente que no sabe actualizarse.

ÁREA NO INDICADAmemoria de clientessoporte técnico
22–28 JUNIO 2026 · #02Imprescindible

DiscoBench: When Search Agents Should Ask

Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu. · 26 junio 2026.

IDEA CENTRAL

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.

POR QUÉ IMPORTA

afecta directamente a asistentes de investigación, soporte y búsqueda empresarial.

Ver problema que intenta resolver

los agentes deep-search asumen que la query del usuario es completa.

ÁREA NO INDICADAagentes webresearch assistants
22–28 JUNIO 2026 · #03Imprescindible

SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in RAG

Ruochang Li, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun. · 26 junio 2026.

IDEA CENTRAL

Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.

POR QUÉ IMPORTA

mejora la fiabilidad de RAG documental y corporativo.

Ver problema que intenta resolver

RAG falla cuando el modelo “cree saber” algo que contradice el documento.

ÁREA NO INDICADAchatbots documentalesQA legal
22–28 JUNIO 2026 · #04Imprescindible

KG2Cypher: Data-Centric Pipeline for Enterprise Text-to-Cypher Systems

Minjun Choi, Yerin Kim, Junghyuk Seo, Sujin Mo, Hyemin Lee, Youngjoong Ko. · 26 junio 2026.

IDEA CENTRAL

Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.

POR QUÉ IMPORTA

es muy aplicable a datos internos, catálogos, BI y búsqueda corporativa.

Ver problema que intenta resolver

consultar grafos privados en lenguaje natural sigue siendo caro y frágil.

ÁREA NO INDICADAknowledge graphsbuscadores internos
22–28 JUNIO 2026 · #05Imprescindible

Robust Harmful Features Under Jailbreak Attacks

Yanchen Yin, Dongqi Han, Linghui Li. · 26 junio 2026; ICML 2026 Oral.

IDEA CENTRAL

Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.

POR QUÉ IMPORTA

puede guiar defensas internas más robustas.

Ver problema que intenta resolver

los jailbreaks se tratan como prompts, pero faltaba evidencia mecanística.

ÁREA NO INDICADAsafety monitorsauditoría
22–28 JUNIO 2026 · #06Interesante

LLawCo: Learning Laws of Cooperation for Embodied Multi-Agent Behavior

Qinhong Zhou, Chuang Gan, Anoop Cherian. · 26 junio 2026; ICML 2026.

IDEA CENTRAL

Framework para que agentes encarnados aprendan “leyes” de cooperación desde fallos pasados, como hablar solo cuando hace falta o esperar al compañero. Introduce PARTNR-Dialog y mejora tasas de éxito en benchmarks cooperativos.

POR QUÉ IMPORTA

útil para robótica, equipos de agentes y coordinación operacional.

Ver problema que intenta resolver

agentes multiagente descoordinados y poco consistentes con el estado del entorno.

ÁREA NO INDICADArobóticaagentes colaborativos
22–28 JUNIO 2026 · #07Interesante

Ko-WideSearch: Breadth-Search Benchmark for Web Agents

Minbyul Jeong. · 25 junio 2026.

IDEA CENTRAL

Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.

POR QUÉ IMPORTA

muchos casos reales son “hazme una lista completa fiable”.

Ver problema que intenta resolver

los benchmarks web miden profundidad, no exhaustividad.

ÁREA NO INDICADAlead generationmarket mapping
22–28 JUNIO 2026 · #08Interesante

CPAgents: Agentic Composite Phenotype Generation for Cardiac Disease Association

Zuoou Li, Wenlong Zhao, Kelly Yu, Weitong Zhang, Paul M. Matthews, Wenjia Bai, Bernhard Kainz, Mengyun Qiao. · 26 junio 2026; MICCAI 2026.

IDEA CENTRAL

Sistema de tres agentes —Analyst, Proposer, Verifier— para descubrir fenotipos cardiovasculares compuestos e interpretables. En cohortes de imagen cardiaca, sus variables compuestas superan a baselines en 56 de 72 combinaciones métrica-enfermedad.

POR QUÉ IMPORTA

buen ejemplo de agentes científicos especializados.

Ver problema que intenta resolver

PheWAS depende de features manuales o monovariables.

ÁREA NO INDICADAbiomarcadoresinvestigación médica
22–28 JUNIO 2026 · #09Interesante

NLL-Guided Full-Attention Layer Selection

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao. · 26 junio 2026.

IDEA CENTRAL

Método training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos. En LongMemEval con Qwen3-4B logra 64,6% de accuracy usando solo 1/4 de capas full-attention, reduciendo coste frente a baselines.

POR QUÉ IMPORTA

baja coste de despliegue de LLMs con contexto largo.

Ver problema que intenta resolver

long-context es caro y no todas las capas necesitan atención completa.

ÁREA NO INDICADARAG largoagentes con historial
22–28 JUNIO 2026 · #10Interesante

EntMTP: Entropy Guided Multi Token Prediction

Carrie Chen. · 25 junio 2026.

IDEA CENTRAL

Scheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto. Reporta 1,15x de speedup frente a Hydra y pico de 1,36x frente a Medusa.

POR QUÉ IMPORTA

mejora throughput sin sacrificar calidad.

Ver problema que intenta resolver

la decodificación especulativa usa profundidad fija aunque no todos los tramos tienen la misma predictibilidad.

ÁREA NO INDICADAserving LLMchatbots de alto volumen
22–28 JUNIO 2026 · #11Interesante

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Peiwen Zhang et al. · 26 junio 2026.

IDEA CENTRAL

Simulador mundial reforzado con física para manipulación robótica. El listado de arXiv indica GitHub y project website asociados.

POR QUÉ IMPORTA

conecta world models, robótica y simulación accionable.

Ver problema que intenta resolver

los modelos generativos de mundo pueden violar física útil para robótica.

ÁREA NO INDICADAentrenamiento robóticosimulación
22–28 JUNIO 2026 · #12Vigilar

Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives

Young Yoon, Jimin Kim, Soyeon Park. · 26 junio 2026.

IDEA CENTRAL

Marco para asignar recompensas en cooperativas de IA donde agentes representan a humanos con restricciones de valor distintas. Propone filtrar gradientes según perfiles de valor y liquidar contribuciones acumuladas.

POR QUÉ IMPORTA

toca federated learning, pluralistic alignment y economía de agentes.

Ver problema que intenta resolver

cómo atribuir valor y recompensas cuando los agentes cooperan con preferencias heterogéneas.

ÁREA NO INDICADAcooperativas de datosAI marketplaces
22–28 JUNIO 2026 · #13Vigilar

Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

Austin MY Cheung, Yi Yang. · 26 junio 2026.

IDEA CENTRAL

Explora si condicionar personalidades menos complacientes puede mejorar seguridad durante fine-tuning. El listado de arXiv lo ubica en safety/fine-tuning con 9 páginas, 8 tablas y 5 figuras.

POR QUÉ IMPORTA

línea práctica para entrenar modelos menos serviles y más seguros.

Ver problema que intenta resolver

los modelos demasiado complacientes pueden seguir instrucciones dañinas o débiles en rechazo.

ÁREA NO INDICADAalignmentfine-tuning corporativo
22–28 JUNIO 2026 · #14Vigilar

Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings

Rostislav Gusev, Alexey Zaytsev. · junio 2026; KDD 2026.

IDEA CENTRAL

Estudia cómo seleccionar datasets que preserven rankings de modelos. El listado de arXiv lo marca aceptado en KDD 2026.

POR QUÉ IMPORTA

muy útil para equipos que comparan modelos de forma continua.

Ver problema que intenta resolver

evaluar modelos en demasiados datasets es caro, pero reducir mal el set distorsiona rankings.

ÁREA NO INDICADAmodel selectionevaluación interna
22–28 JUNIO 2026 · #15Vigilar

From Signals to Transfer: Probe-Based Uncertainty Estimation in LLMs

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu. · 26 junio 2026.

IDEA CENTRAL

Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.

POR QUÉ IMPORTA

incertidumbre calibrada es básica para agentes con aprobación humana.

Ver problema que intenta resolver

saber cuándo un LLM no es fiable sigue siendo difícil.

ÁREA NO INDICADAhuman-in-the-loopQA crítico