NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 11

MEMORIA · AGENTES · RAG

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

InteresanteLectura primaria completa

Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo.

AUTHORS / LABXiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang
FECHA2 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.

EVIDENCIA DISPONIBLE

Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations).

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.

SEÑALgaming · SaaS
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations).

baseline: Comparación declarada en la sección de evaluación · contexto: 6 Results

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.

MÉTODO / La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and… [Fuente: https://arxiv.org/html/2607.02255#S4]

RESULTADO / La sección 6 Results informa: Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations). [Fuente: https://arxiv.org/html/2607.02255#S6]

LÍMITE / El cierre de la fuente señala: The bounded contract is a concrete, measurable design point for the memory stage of closed-rule, turn-based agent loops: per-decision typed retrieval keeps the online context bounded regardless of run length, typed stores make memory updates auditable, and postrun writes expose learning as explicit artifacts rather than opaque transcript growth. Whether this pattern is the right default for open-ended production loops is untested here; what we provide is… La transferencia a diseño de memoria requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.02255#S8].

DECISIÓN RÁPIDAProbar la propuesta en diseño de memoria reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.

PROBLEMA
Los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.
MÉTODO
La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and…
TIPO DE EVIDENCIA
La sección 6 Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02255#S6.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and…

QUÉ APORTA

Buen laboratorio para estudiar qué memoria ayuda realmente en decisiones prolongadas.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.

Cómo lo llevaría a un proyecto

Probar la propuesta en diseño de memoria reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

diseño de memoriaagentes estratégicossimulaciónevaluación long-horizon.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando diseño de memoria cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAdiseño de memoria con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora diseño de memoria frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si diseño de memoria puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.