NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 10

WORLD MODELS · MEMORIA · PLANIFICACIÓN

MemWM: Memory-Augmented Text-Based World Model

InteresanteLectura primaria completa

Imaginar un futuro plausible no basta si el modelo olvida una regla, atributo o estado que cambia la decisión.

AUTHORS / LABYujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye y colaboradores
FECHA07 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.

EVIDENCIA DISPONIBLE

La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT y hasta 65,4% de mejora relativa en ALFWorld, WebShop y ScienceWorld.

Resultado reportado con fuente enlazada · 3 localizadores disponibles.
LÍMITE

Structured State Fidelity y tareas textuales no cubren toda la incertidumbre física o social; una memoria de reglas incorrecta puede hacer la imaginación más consistente y equivocada.

SIGUIENTE PRUEBA

Éxito, SSF, recuperación de restricciones, errores por estado stale y tokens.

EN UNA FRASE

MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.

SEÑALMemoria · World models · Planificación
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT y hasta 65,4% de mejora relativa en ALFWorld, WebShop y ScienceWorld.

+206,3% SSF; hasta +65,4% relativo · baseline: SFT · contexto: ALFWorld, WebShop y ScienceWorld

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

MemWM trata un problema de los world models textuales: pueden generar una continuación fluida que omite un atributo, corrompe un producto o aplica una regla de transición incorrecta. Para un agente que planifica sobre esa imaginación, una frase plausible pero infiel puede ser peor que una abstención.

El sistema construye una world memory con tres clases de contenido: reglas de transición, caches de estado y hechos difíciles de predecir. En la planificación, la política recupera un world task skill y guidance correctivo; después el world model imagina el siguiente estado de cada acción candidata con ayuda de esa memoria.

El paper propone Structured State Fidelity para comparar estados predichos y reales mediante hechos y campos del benchmark. El entrenamiento aumentado por memoria mejora SSF hasta 206,3% frente a SFT; en planificación downstream, los experimentos en ALFWorld, WebShop y ScienceWorld alcanzan hasta 65,4% de mejora relativa.

La aportación es una defensa contra el olvido estructural, no una solución general a la imaginación. Si una regla entra mal en la memoria, el sistema puede volverse más coherente y más peligroso. La siguiente prueba debería incluir procedencia, caducidad y contradicciones deliberadas antes de usar el patrón en un entorno operativo.

DECISIÓN RÁPIDASeparar en una simulación las reglas, caches y hechos difíciles de predecir, y medir cuándo cada tipo de memoria evita una acción incorrecta.
NO LO SOBREINTERPRETES

Structured State Fidelity y tareas textuales no cubren toda la incertidumbre física o social; una memoria de reglas incorrecta puede hacer la imaginación más consistente y equivocada.

PROBLEMA
Los estados futuros generados pueden sonar coherentes y, al mismo tiempo, omitir hechos críticos o aplicar reglas de transición incorrectas.
MÉTODO
Recupera reglas de transición, caches de estado y hechos difíciles de predecir para condicionar la imaginación del world model; además, entrega skills y guidance a la política.
TIPO DE EVIDENCIA
La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT; en ALFWorld, WebShop y ScienceWorld el agente obtiene hasta 65,4% de mejora relativa sobre el agente con world model SFT.
LÍMITE
Structured State Fidelity y tareas textuales no cubren toda la incertidumbre física o social; una memoria de reglas incorrecta puede hacer la imaginación más consistente y equivocada.
FIGURA DE LECTURA / WORLD MODELRegla → estado → imaginación → acción
Abrir paper original ↗

La memoria protege la planificación de futuros fluidos pero infieles.

RECORDARReglas y hechos
IMAGINARSiguiente estado
PLANIFICARElegir acción
PARA RECORDAR

Un world model debe recordar las reglas que no puede permitirse inventar.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / La memoria mejora hasta 206,3% Structured State Fidelity frente a SFT; en ALFWorld, WebShop y ScienceWorld el agente obtiene hasta 65,4% de mejora relativa sobre el agente con world model SFT.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Recupera reglas de transición, caches de estado y hechos difíciles de predecir para condicionar la imaginación del world model; además, entrega skills y guidance a la política.

QUÉ APORTA

La memoria se convierte en una defensa contra la imaginación fluida pero infiel, especialmente cuando el agente usa el modelo para valorar acciones antes de ejecutarlas.

QUÉ NO PRUEBA

Structured State Fidelity y tareas textuales no cubren toda la incertidumbre física o social; una memoria de reglas incorrecta puede hacer la imaginación más consistente y equivocada.

Cómo lo llevaría a un proyecto

Separar en una simulación las reglas, caches y hechos difíciles de predecir, y medir cuándo cada tipo de memoria evita una acción incorrecta.

PlanificaciónRobóticaAgentes webSimulaciónVideojuegos

Preguntas que conviene probar

  • ¿Qué hechos deben entrar en world memory y con qué procedencia?
  • ¿Cuándo una regla recordada debe caducar o pedir verificación?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADATres entornos con tareas holdout, memoria activada/desactivada y perturbaciones de estado, con tres semillas.
PREGUNTA¿La mejora de memoria se traduce en éxito robusto cuando se cambian tareas y aparecen estados contradictorios?
MÉTRICAÉxito, SSF, recuperación de restricciones, errores por estado stale y tokens.
PARADAParar si SSF sube sin al menos 5% de mejora en éxito o si los errores stale superan 3%.

Mi lectura

Un world model necesita recordar las reglas que no puede permitirse inventar antes de recomendar una acción.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.