22–28 JUNIO 2026 · #01Imprescindible
Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents
Vedant Patel. · 25 junio 2026.
IDEA CENTRALAísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded.
POR QUÉ IMPORTAesto es clave para asistentes personales, CRM y agentes empresariales reales.
Ver problema que intenta resolver
memoria persistente que no sabe actualizarse.
ÁREA NO INDICADAmemoria de clientessoporte técnico
22–28 JUNIO 2026 · #02Imprescindible
DiscoBench: When Search Agents Should Ask
Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu. · 26 junio 2026.
IDEA CENTRALBenchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
POR QUÉ IMPORTAafecta directamente a asistentes de investigación, soporte y búsqueda empresarial.
Ver problema que intenta resolver
los agentes deep-search asumen que la query del usuario es completa.
ÁREA NO INDICADAagentes webresearch assistants
22–28 JUNIO 2026 · #03Imprescindible
SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in RAG
Ruochang Li, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun. · 26 junio 2026.
IDEA CENTRALAtaca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.
POR QUÉ IMPORTAmejora la fiabilidad de RAG documental y corporativo.
Ver problema que intenta resolver
RAG falla cuando el modelo “cree saber” algo que contradice el documento.
ÁREA NO INDICADAchatbots documentalesQA legal
22–28 JUNIO 2026 · #04Imprescindible
KG2Cypher: Data-Centric Pipeline for Enterprise Text-to-Cypher Systems
Minjun Choi, Yerin Kim, Junghyuk Seo, Sujin Mo, Hyemin Lee, Youngjoong Ko. · 26 junio 2026.
IDEA CENTRALPipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.
POR QUÉ IMPORTAes muy aplicable a datos internos, catálogos, BI y búsqueda corporativa.
Ver problema que intenta resolver
consultar grafos privados en lenguaje natural sigue siendo caro y frágil.
ÁREA NO INDICADAknowledge graphsbuscadores internos
22–28 JUNIO 2026 · #05Imprescindible
Robust Harmful Features Under Jailbreak Attacks
Yanchen Yin, Dongqi Han, Linghui Li. · 26 junio 2026; ICML 2026 Oral.
IDEA CENTRALEstudia mecánicamente qué pasa dentro de un LLM durante jailbreaks. Encuentra cabezas de atención comprometidas y cabezas alineadas con seguridad; las señales dañinas persisten incluso cuando el modelo falla externamente. Leer esas activaciones permite detección robusta sin entrenamiento.
POR QUÉ IMPORTApuede guiar defensas internas más robustas.
Ver problema que intenta resolver
los jailbreaks se tratan como prompts, pero faltaba evidencia mecanística.
ÁREA NO INDICADAsafety monitorsauditoría
22–28 JUNIO 2026 · #06Interesante
LLawCo: Learning Laws of Cooperation for Embodied Multi-Agent Behavior
Qinhong Zhou, Chuang Gan, Anoop Cherian. · 26 junio 2026; ICML 2026.
IDEA CENTRALFramework para que agentes encarnados aprendan “leyes” de cooperación desde fallos pasados, como hablar solo cuando hace falta o esperar al compañero. Introduce PARTNR-Dialog y mejora tasas de éxito en benchmarks cooperativos.
POR QUÉ IMPORTAútil para robótica, equipos de agentes y coordinación operacional.
Ver problema que intenta resolver
agentes multiagente descoordinados y poco consistentes con el estado del entorno.
ÁREA NO INDICADArobóticaagentes colaborativos
22–28 JUNIO 2026 · #07Interesante
Ko-WideSearch: Breadth-Search Benchmark for Web Agents
Minbyul Jeong. · 25 junio 2026.
IDEA CENTRALBenchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.
POR QUÉ IMPORTAmuchos casos reales son “hazme una lista completa fiable”.
Ver problema que intenta resolver
los benchmarks web miden profundidad, no exhaustividad.
ÁREA NO INDICADAlead generationmarket mapping
22–28 JUNIO 2026 · #08Interesante
CPAgents: Agentic Composite Phenotype Generation for Cardiac Disease Association
Zuoou Li, Wenlong Zhao, Kelly Yu, Weitong Zhang, Paul M. Matthews, Wenjia Bai, Bernhard Kainz, Mengyun Qiao. · 26 junio 2026; MICCAI 2026.
IDEA CENTRALSistema de tres agentes —Analyst, Proposer, Verifier— para descubrir fenotipos cardiovasculares compuestos e interpretables. En cohortes de imagen cardiaca, sus variables compuestas superan a baselines en 56 de 72 combinaciones métrica-enfermedad.
POR QUÉ IMPORTAbuen ejemplo de agentes científicos especializados.
Ver problema que intenta resolver
PheWAS depende de features manuales o monovariables.
ÁREA NO INDICADAbiomarcadoresinvestigación médica
22–28 JUNIO 2026 · #09Interesante
NLL-Guided Full-Attention Layer Selection
Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao. · 26 junio 2026.
IDEA CENTRALMétodo training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos. En LongMemEval con Qwen3-4B logra 64,6% de accuracy usando solo 1/4 de capas full-attention, reduciendo coste frente a baselines.
POR QUÉ IMPORTAbaja coste de despliegue de LLMs con contexto largo.
Ver problema que intenta resolver
long-context es caro y no todas las capas necesitan atención completa.
ÁREA NO INDICADARAG largoagentes con historial
22–28 JUNIO 2026 · #10Interesante
EntMTP: Entropy Guided Multi Token Prediction
Carrie Chen. · 25 junio 2026.
IDEA CENTRALScheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto. Reporta 1,15x de speedup frente a Hydra y pico de 1,36x frente a Medusa.
POR QUÉ IMPORTAmejora throughput sin sacrificar calidad.
Ver problema que intenta resolver
la decodificación especulativa usa profundidad fija aunque no todos los tramos tienen la misma predictibilidad.
ÁREA NO INDICADAserving LLMchatbots de alto volumen
22–28 JUNIO 2026 · #11Interesante
PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
Peiwen Zhang et al. · 26 junio 2026.
IDEA CENTRALSimulador mundial reforzado con física para manipulación robótica. El listado de arXiv indica GitHub y project website asociados.
POR QUÉ IMPORTAconecta world models, robótica y simulación accionable.
Ver problema que intenta resolver
los modelos generativos de mundo pueden violar física útil para robótica.
ÁREA NO INDICADAentrenamiento robóticosimulación
22–28 JUNIO 2026 · #12Vigilar
Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives
Young Yoon, Jimin Kim, Soyeon Park. · 26 junio 2026.
IDEA CENTRALMarco para asignar recompensas en cooperativas de IA donde agentes representan a humanos con restricciones de valor distintas. Propone filtrar gradientes según perfiles de valor y liquidar contribuciones acumuladas.
POR QUÉ IMPORTAtoca federated learning, pluralistic alignment y economía de agentes.
Ver problema que intenta resolver
cómo atribuir valor y recompensas cuando los agentes cooperan con preferencias heterogéneas.
ÁREA NO INDICADAcooperativas de datosAI marketplaces
22–28 JUNIO 2026 · #13Vigilar
Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning
Austin MY Cheung, Yi Yang. · 26 junio 2026.
IDEA CENTRALExplora si condicionar personalidades menos complacientes puede mejorar seguridad durante fine-tuning. El listado de arXiv lo ubica en safety/fine-tuning con 9 páginas, 8 tablas y 5 figuras.
POR QUÉ IMPORTAlínea práctica para entrenar modelos menos serviles y más seguros.
Ver problema que intenta resolver
los modelos demasiado complacientes pueden seguir instrucciones dañinas o débiles en rechazo.
ÁREA NO INDICADAalignmentfine-tuning corporativo
22–28 JUNIO 2026 · #14Vigilar
Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings
Rostislav Gusev, Alexey Zaytsev. · junio 2026; KDD 2026.
IDEA CENTRALEstudia cómo seleccionar datasets que preserven rankings de modelos. El listado de arXiv lo marca aceptado en KDD 2026.
POR QUÉ IMPORTAmuy útil para equipos que comparan modelos de forma continua.
Ver problema que intenta resolver
evaluar modelos en demasiados datasets es caro, pero reducir mal el set distorsiona rankings.
ÁREA NO INDICADAmodel selectionevaluación interna
22–28 JUNIO 2026 · #15Vigilar
From Signals to Transfer: Probe-Based Uncertainty Estimation in LLMs
Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu. · 26 junio 2026.
IDEA CENTRALEstudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios. Aparece en cs.CL/cs.AI como trabajo específico sobre estimación de incertidumbre en LLMs.
POR QUÉ IMPORTAincertidumbre calibrada es básica para agentes con aprobación humana.
Ver problema que intenta resolver
saber cuándo un LLM no es fiable sigue siendo difícil.
ÁREA NO INDICADAhuman-in-the-loopQA crítico