Lo esencial antes de invertir más tiempo.
Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.
Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations).
Resultado reportado con fuente enlazada · 6 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo. Libera 298 trayectorias, snapshots de memoria/skills, prompts y scripts de análisis.
Qué está reportado y qué conviene comprobar.
Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations).
baseline: Comparación declarada en la sección de evaluación · contexto: 6 Results
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.
MÉTODO / La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and… [Fuente: https://arxiv.org/html/2607.02255#S4]
RESULTADO / La sección 6 Results informa: Establishing whether the bounded contract itself outperforms a matched accumulating-context design would require the controlled comparison we leave to future work (Limitations). [Fuente: https://arxiv.org/html/2607.02255#S6]
LÍMITE / El cierre de la fuente señala: The bounded contract is a concrete, measurable design point for the memory stage of closed-rule, turn-based agent loops: per-decision typed retrieval keeps the online context bounded regardless of run length, typed stores make memory updates auditable, and postrun writes expose learning as explicit artifacts rather than opaque transcript growth. Whether this pattern is the right default for open-ended production loops is untested here; what we provide is… La transferencia a diseño de memoria requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.02255#S8].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
- PROBLEMA
- Los agentes long-horizon mezclan memoria, transcript y reflexiones de forma difícil de aislar.
- MÉTODO
- La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and…
- TIPO DE EVIDENCIA
- La sección 6 Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02255#S6.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 4 Architecture: Per-Decision Typed Retrieval describe la intervención y su construcción: This section specifies what the LLM is allowed to see when it makes a move. The agent never appends the raw message turns from earlier decisions. Instead, it rebuilds each decision prompt from five typed knowledge layers (Figure 2 b). Any information that survives across decisions must first be written into a bounded store; in our experiments, postrun extraction and skill discovery can write back only to L_{4}/L_{5} . The contract gives the resource four evaluation handles that a raw prompt-history setup usually hides: horizon growth is capped by slot budgets; retrieved evidence is labeled by layer; L_{4} and…
Buen laboratorio para estudiar qué memoria ayuda realmente en decisiones prolongadas.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Results.
Cómo lo llevaría a un proyecto
Probar la propuesta en diseño de memoria reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando diseño de memoria cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si diseño de memoria puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.