NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 14

AGENTES · EVALUACIÓN

LongMedBench: Medical Agents for Long-Horizon Clinical Decision-Making

VigilarLectura primaria completa

Benchmark clínico longitudinal construido con historiales de MIMIC-IV.

AUTHORS / LABZihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu
FECHA10 JULIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

EVIDENCIA DISPONIBLE

, m\in\{1,2,3\} in \mathcal{M}_{E} ) and full history ( m=\infty ) against the Agent Memory system (Mem0).

Resultado reportado con fuente enlazada · 6 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments and Results.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

SEÑALhospitales · salud digital
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

Table 2 reveals that naive-LLM’s performance decays severely as history grows , dropping from 0.882 to 0.423 in explicit retrieval, with low Lab-F scores ( \leq 0.570) highlighting a pervasive hallucination bias.

contexto: 3 Experiments and Results

RESULTADO REPORTADO

The performance of agent memory system is strongly correlated with the specific task type ; while Mem0 achieves near-optimal results in explicit Lab-T (0.993) and Medication (0.983), its relative performance (Overall 0.331) remains inferior.

contexto: 3 Experiments and Results

RESULTADO REPORTADO

This gap reveals that: first, agents struggle to generate precise queries for imaging reports even with few-shot prompting; interestingly, when falling back to vector-based search, relative semantic queries outperform explicit ID/timestamp matching, as the latter lacks sufficient embedding density in vector space; second, the agent’s memory architecture lacks a systematic indexing of relationships between events.

baseline: Comparación declarada en la sección de evaluación · contexto: 3 Experiments and Results

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque Los benchmarks médicos suelen reducir la asistencia clínica a preguntas cortas o episodios aislados.

MÉTODO / La lectura de 2 Methodology describe la intervención y su construcción: LongMedBench is built on MIMIC-IV [ 7 ] , a public database that contains medical records for >100,000 patients. To convert static EHRs into an interactive agent environment, we design a three-stage pipeline (Figure 1 ). To reduce redundancy while preserving clinical signals, we retain only abnormal lab results and patients with complete admission/discharge records. Filtering for patients with \geq 15 hospitalizations yields 355 patients and 6,999 visits. With an average of 19.72 visits per patient (median=18.00, SD=5.72), this dense multi-session structure rigorously evaluates the agent’s ability in… [Fuente: https://arxiv.org/html/2607.09322#S2]

RESULTADO / La sección 3 Experiments and Results informa: , m\in\{1,2,3\} in \mathcal{M}_{E} ) and full history ( m=\infty ) against the Agent Memory system (Mem0). Table 2 reveals that naive-LLM’s performance decays severely as history grows , dropping from 0.882 to 0.423 in explicit retrieval, with low Lab-F scores ( \leq 0.570) highlighting a pervasive hallucination bias. The performance of agent memory system is strongly correlated with the specific task type ; while Mem0 achieves near-optimal results in explicit Lab-T (0.993) and Medication (0.983), its relative performance (Overall 0.331) remains inferior. [Fuente: https://arxiv.org/html/2607.09322#S3]

LÍMITE / El cierre de la fuente señala: We introduce LongMedBench, a benchmark using real-world EHR data to evaluate medical agents in long-horizon clinical reasoning. By converting MIMIC-IV records into multi-session event streams, we assess agents across three memory types with varying tasks. Experiments reveal that while state-of-the-art models handle explicit timestamps well, implicit temporal reasoning remains a significant bottleneck. As history scales, models increasingly rely on… La transferencia a soporte clínico requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.09322#S4].

DECISIÓN RÁPIDAProbar la propuesta en soporte clínico reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments and Results.

PROBLEMA
Los benchmarks médicos suelen reducir la asistencia clínica a preguntas cortas o episodios aislados.
MÉTODO
La lectura de 2 Methodology describe la intervención y su construcción: LongMedBench is built on MIMIC-IV [ 7 ] , a public database that contains medical records for >100,000 patients. To convert static EHRs into an interactive agent environment, we design a three-stage pipeline (Figure 1 ). To reduce redundancy while preserving clinical signals, we retain only abnormal lab results and patients with complete admission/discharge records. Filtering for patients with \geq 15 hospitalizations yields 355 patients and 6,999 visits. With an average of 19.72 visits per patient (median=18.00, SD=5.72), this dense multi-session structure rigorously evaluates the agent’s ability in…
TIPO DE EVIDENCIA
La sección 3 Experiments and Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.09322#S3.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments and Results.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Methodology describe la intervención y su construcción: LongMedBench is built on MIMIC-IV [ 7 ] , a public database that contains medical records for >100,000 patients. To convert static EHRs into an interactive agent environment, we design a three-stage pipeline (Figure 1 ). To reduce redundancy while preserving clinical signals, we retain only abnormal lab results and patients with complete admission/discharge records. Filtering for patients with \geq 15 hospitalizations yields 355 patients and 6,999 visits. With an average of 19.72 visits per patient (median=18.00, SD=5.72), this dense multi-session structure rigorously evaluates the agent’s ability in…

QUÉ APORTA

Los resultados muestran que RAG y memoria ayudan a recuperar información, pero las decisiones clínicas siguen dependiendo en gran medida del contexto inmediato. Eso limita el uso seguro de agentes como gestores longitudinales del paciente.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 3 Experiments and Results.

Cómo lo llevaría a un proyecto

Probar la propuesta en soporte clínico reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

soporte clínicoresumen de historialesseguimiento y auditoría de agentes médicos.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando soporte clínico cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAsoporte clínico con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora soporte clínico frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si soporte clínico puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.