NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 08 · 27 Julio–2 Agosto 2026
27 JULIO–2 AGOSTO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 27 julio–2 agosto 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza memoria, long-context, agentes. para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir TransMem: Transforming Hidden States into Memory for Large Language Models.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

TransMem: Transforming Hidden States into Memory for Large Language Models

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante. La pregunta de producto que queda abierta es: Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo. Por qué puede ser importante: Señala que la memoria futura podría residir parcialmente en el espacio latente, no solo en bases vectoriales o documentos. Mejora entre 11,58 y 29,25 puntos F1 en LoCoMo, entre 10,20 y 13,03 en HotpotQA, y eleva MemoryAgentBench de 29,54% a 40%.

02 / IMPRESCINDIBLE

Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies

Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales. La pregunta de producto que queda abierta es: Los benchmarks verificables miden tareas estrechas, mientras que enviar papers generados a revisión académica introduce mucho ruido. Por qué puede ser importante: Es una corrección necesaria frente a predicciones de automatización total de la ciencia. Identifica fallos recurrentes en criterio científico, creatividad, backtracking, uso de recursos y mantenimiento del objetivo.

03 / IMPRESCINDIBLE

Aries: Rethinking AI Cloud Infrastructure for Agentic Serving Systems

Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial. La pregunta de producto que queda abierta es: La infraestructura LLM actual optimiza tokens y batches, pero los agentes alternan razonamiento, llamadas externas, esperas y ráfagas cortas de ejecución. Por qué puede ser importante: Muestra que las métricas token-centric ocultan cuellos de botella relevantes; que añadir más contexto produce rendimientos decrecientes; y que los sandboxes permanecen ociosos durante largos intervalos, aunque suspenderlos resulte caro.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    MEMORIA · AGENTES · EVALUACIÓN

    TransMem

    TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29032#Sx4.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    AGENTES · RAG · EVALUACIÓN

    Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case S

    Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante.

    La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.27191#S4.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    MEMORIA · AGENTES

    Aries

    Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones.

    La sección 4. Why Is Modern Cloud AI Infrastructure a Poor Fit for Agents? informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29069#S4.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    AGENTES · SEGURIDAD · CODING

    SkillGate

    SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes.

    La sección Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25619#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    AGENTES · RAG · EVALUACIÓN

    WorkSurface-Bench

    Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes.

    La sección 3 Benchmark Construction informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25765#S3.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    AGENTES · SEGURIDAD · MULTIMODAL

    Piggybacking on Perception

    Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria.

    La sección VI. Evaluation informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28165#S6.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    RAG · EVALUACIÓN · CODING

    DenseOn with the LateOn

    Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía.

    La sección 3 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.27178#S3.
    Imprescindibleneeds-reviewLeer ficha
  8. 08
    RAG · EVALUACIÓN

    GLM-RAG

    Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28397#S5.
    Interesanteneeds-reviewLeer ficha
  9. 09
    RAG · MULTIMODAL

    DualG-MRAG

    Separa dos escalas de recuperación.

    La sección 5. Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28580#S5.
    Interesanteneeds-reviewLeer ficha
  10. 10
    MEMORIA · AGENTES · MODELOS PEQUEÑOS

    NeSyFS

    Representa el estado de creencias del agente mediante un knowledge graph.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28942#Sx4.
    Interesanteneeds-reviewLeer ficha
  11. 11
    AGENTES · RAG

    RecHarness

    Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29241#Sx4.
    Interesanteneeds-reviewLeer ficha
  12. 12
    AGENTES · SEGURIDAD

    Explanation-Bound Tool Execution for AI Agents

    Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor.

    La sección Deterministic Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25364#S9.
    Interesanteneeds-reviewLeer ficha
  13. 13
    AGENTES · RAG · EVALUACIÓN

    TraceCoder

    Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión.

    La sección 6 Experimental Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.26307#S6.
    Interesanteneeds-reviewLeer ficha
  14. 14
    MEMORIA · AGENTES · SEGURIDAD

    EasyBCI Agent

    Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29007#S4.
    Vigilarneeds-reviewLeer ficha
  15. 15
    AGENTES · SEGURIDAD

    Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayes

    Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.

    La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25877#S5.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir TransMem: Transforming Hidden States into Memory for Large Language Models y localizar su resultado principal en la fuente primaria.
  2. Contrastar Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain