Este corte cruza memoria, long-context, agentes. para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir TransMem: Transforming Hidden States into Memory for Large Language Models.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
TransMem: Transforming Hidden States into Memory for Large Language Models
TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante. La pregunta de producto que queda abierta es: Los agentes con historiales largos pagan repetidamente por releer texto y pueden perder información importante al resumirlo. Por qué puede ser importante: Señala que la memoria futura podría residir parcialmente en el espacio latente, no solo en bases vectoriales o documentos. Mejora entre 11,58 y 29,25 puntos F1 en LoCoMo, entre 10,20 y 13,03 en HotpotQA, y eleva MemoryAgentBench de 29,54% a 40%.
Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies
Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante. Los agentes recibieron seis días y miles de dólares de cómputo. Completaron la ingeniería experimental, pero no produjeron avances científicos sustanciales. La pregunta de producto que queda abierta es: Los benchmarks verificables miden tareas estrechas, mientras que enviar papers generados a revisión académica introduce mucho ruido. Por qué puede ser importante: Es una corrección necesaria frente a predicciones de automatización total de la ciencia. Identifica fallos recurrentes en criterio científico, creatividad, backtracking, uso de recursos y mantenimiento del objetivo.
Aries: Rethinking AI Cloud Infrastructure for Agentic Serving Systems
Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial. La pregunta de producto que queda abierta es: La infraestructura LLM actual optimiza tokens y batches, pero los agentes alternan razonamiento, llamadas externas, esperas y ráfagas cortas de ejecución. Por qué puede ser importante: Muestra que las métricas token-centric ocultan cuellos de botella relevantes; que añadir más contexto produce rendimientos decrecientes; y que los sandboxes permanecen ociosos durante largos intervalos, aunque suspenderlos resulte caro.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
MEMORIA · AGENTES · EVALUACIÓN
TransMem
TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29032#Sx4.
Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case S
Introduce las shadow evaluations: se entrega a un agente la pregunta central de un paper de alta calidad todavía no publicado y los autores originales evalúan el trabajo resultante.
La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.27191#S4.
Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones.
La sección 4. Why Is Modern Cloud AI Infrastructure a Poor Fit for Agents? informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29069#S4.
SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes.
La sección Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25619#S4.
Evalúa si un agente sabe elegir entre documentos, tablas, grafos de dependencias o combinaciones de esas fuentes.
La sección 3 Benchmark Construction informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25765#S3.
Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria.
La sección VI. Evaluation informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28165#S6.
Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía.
La sección 3 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.27178#S3.
Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28397#S5.
La sección 5. Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28580#S5.
Representa el estado de creencias del agente mediante un knowledge graph.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.28942#Sx4.
Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29241#Sx4.
Propone ligar cada acción de herramienta a afirmaciones comprobables por el servidor.
La sección Deterministic Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25364#S9.
Conserva el historial de cada fragmento de código: benchmark que provocó el cambio, ronda, error, explicación del modelo y versión.
La sección 6 Experimental Evaluation informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.26307#S6.
Un agente de planificación convierte cada registro neurofisiológico en una huella textual que no revela los datos crudos.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.29007#S4.
Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayes
Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.
La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.25877#S5.
Abrir TransMem: Transforming Hidden States into Memory for Large Language Models y localizar su resultado principal en la fuente primaria.
Contrastar Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR
La señal también tiene sombra.
Una ficha abierta no equivale a una recomendación de adopción.
Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.