# MemWM: Memory-Augmented Text-Based World Model
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/memwm
- Fuente primaria: https://arxiv.org/abs/2608.07107
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye y colaboradores
- Fecha del corte: 07 AGO 2026
- Área: WORLD MODELS · MEMORIA · PLANIFICACIÓN

## Tesis y contexto

MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.

- Problema: Los estados futuros generados pueden sonar coherentes y, al mismo tiempo, omitir hechos críticos o aplicar reglas de transición incorrectas.
- Por qué importa: La memoria se convierte en una defensa contra la imaginación fluida pero infiel, especialmente cuando el agente usa el modelo para valorar acciones antes de ejecutarlas.

## Evidencia reportada

- **reported-result**: La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT y hasta 65,4% de mejora relativa en ALFWorld, WebShop y ScienceWorld. [localizador](https://arxiv.org/html/2608.07107v1#S3)

## Lectura y límite

- Método: Recupera reglas de transición, caches de estado y hechos difíciles de predecir para condicionar la imaginación del world model; además, entrega skills y guidance a la política.
- Límite: Structured State Fidelity y tareas textuales no cubren toda la incertidumbre física o social; una memoria de reglas incorrecta puede hacer la imaginación más consistente y equivocada.
- Confianza editorial: Media
- Limitación: Structured State Fidelity es una métrica de memoria y los resultados se concentran en ALFWorld, WebShop y ScienceWorld; una mejora del proxy no garantiza control del agente.
- Limitación: La comparación con SFT depende del protocolo de entrenamiento, del horizonte y de qué estado se considera estructurado; faltan pruebas de memoria obsoleta y transferencia.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.07107): tipo abstract
- [Arquitectura y SSF · HTML](https://arxiv.org/html/2608.07107v1#S3): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.07107): tipo abstract

## Próxima prueba

- ¿La mejora de memoria se traduce en éxito robusto cuando se cambian tareas y aparecen estados contradictorios?
- Métrica: Éxito, SSF, recuperación de restricciones, errores por estado stale y tokens.
- Regla de parada: Parar si SSF sube sin al menos 5% de mejora en éxito o si los errores stale superan 3%.

## Recursos reproducibles
- [HTML · fuente navegable](https://arxiv.org/html/2608.07107v1)

## Enlaces relacionados

- [CoEvo-Mem](https://luiseduardodemiguel.com/research-ia/markdown/papers/coevo-mem)
- [LiveMem](https://luiseduardodemiguel.com/research-ia/markdown/papers/livemem)
- [VibeLifeBench](https://luiseduardodemiguel.com/research-ia/markdown/papers/vibelifebench)