NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 03 · 22–28 Junio 2026
22–28 JUNIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 22–28 junio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos. En LongMemEval, sustituir contexto completo por memoria autogestionada baja la precisión de 92% a 77%, y el problema empeora al crecer la conversación. Propone un entorno RL abierto para entrenar agentes a priorizar hechos vigentes frente a hechos superseded. La pregunta de producto que queda abierta es: memoria persistente que no sabe actualizarse.

02 / IMPRESCINDIBLE

DiscoBench: When Search Agents Should Ask

Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas. La pregunta de producto que queda abierta es: los agentes deep-search asumen que la query del usuario es completa.

03 / IMPRESCINDIBLE

SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in RAG

Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets. La pregunta de producto que queda abierta es: RAG falla cuando el modelo “cree saber” algo que contradice el documento.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    MEMORIA · AGENTES

    Supersede

    Aísla un fallo crítico de los agentes con memoria: cuando un dato cambia, el agente conserva información obsoleta y responde con valores antiguos.

    La sección 5 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27472#S5.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    AGENTES · RAG · EVALUACIÓN

    DiscoBench

    Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27669#S5.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    RAG · EVALUACIÓN · MODELOS PEQUEÑOS

    SHIFT

    Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG.

    La sección 5 Experimental Analysis informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27786#S5.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    MODELOS PEQUEÑOS

    KG2Cypher

    Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados.

    La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27742#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    MEMORIA · SEGURIDAD

    Robust Harmful Features Under Jailbreak Attacks

    Estudia mecánicamente qué pasa dentro de un LLM durante jailbreaks.

    La sección Impact Statement informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.28153#Sx2.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    AGENTES · EVALUACIÓN

    LLawCo

    Framework para que agentes encarnados aprendan “leyes” de cooperación desde fallos pasados, como hablar solo cuando hace falta o esperar al compañero.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.28182#S4.
    Interesanteneeds-reviewLeer ficha
  7. 07
    AGENTES · RAG · EVALUACIÓN

    Ko-WideSearch

    Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos.

    La sección Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27595#Sx5.
    Interesanteneeds-reviewLeer ficha
  8. 08
    AGENTES · MULTIMODAL

    CPAgents

    Sistema de tres agentes —Analyst, Proposer, Verifier— para descubrir fenotipos cardiovasculares compuestos e interpretables.

    La sección 3 Experiments and Results informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.28179#S3.
    Interesanteneeds-reviewLeer ficha
  9. 09
    EVALUACIÓN

    NLL-Guided Full-Attention Layer Selection

    Método training-free para decidir qué capas deben mantener full attention en modelos long-context híbridos.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27791#S4.
    Interesanteneeds-reviewLeer ficha
  10. 10
    IA APLICADA · EVALUACIÓN

    EntMTP

    Scheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto.

    La sección 6 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27550#S6.
    Interesanteneeds-reviewLeer ficha
  11. 11
    IA APLICADA · EVALUACIÓN

    PhysisForcing

    Simulador mundial reforzado con física para manipulación robótica.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.28128#S4.
    Interesanteneeds-reviewLeer ficha
  12. 12
    AGENTES

    Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperativ

    Marco para asignar recompensas en cooperativas de IA donde agentes representan a humanos con restricciones de valor distintas.

    La sección 3 Framework informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.28217#S3.
    Vigilarneeds-reviewLeer ficha
  13. 13
    SEGURIDAD

    Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

    Explora si condicionar personalidades menos complacientes puede mejorar seguridad durante fine-tuning.

    La sección 4 Results informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27709#S4.
    Vigilarneeds-reviewLeer ficha
  14. 14
    EVALUACIÓN

    Benchmarking on Tasks That Matter

    Estudia cómo seleccionar datasets que preserven rankings de modelos.

    La sección 6. Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27997#S6.
    Vigilarneeds-reviewLeer ficha
  15. 15
    IA APLICADA · EVALUACIÓN

    From Signals to Transfer

    Estudia señales de incertidumbre basadas en probes y su capacidad de transferir entre escenarios.

    La sección 3 What Drives Probe Performance? informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.27679#S3.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents y localizar su resultado principal en la fuente primaria.
  2. Contrastar DiscoBench: When Search Agents Should Ask con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain