NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Contexto multimodal y del mundo

La representación útil combina texto, imagen, vídeo, espacio y tiempo para sostener una decisión situada.

POR QUÉ APARECE

Aparece en 43 documentos, 27 papers y 11 semanas; conecta 8 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD4/10
CONEXIÓN9/10
DOCUMENTOS43
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#43 · RAG · EVALUACIÓN · MULTIMODAL

Earth-OneVision

Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.

Resultado con fuente enlazada · v1
#62 · MEMORIA · AGENTES

S-Agent

Framework agentic para razonamiento espacial continuo con herramientas jerárquicas y memoria temporal sobre imágenes multi-vista y vídeo.

Resultado con fuente enlazada · v3
#78 · IA APLICADA · EVALUACIÓN

PhysisForcing

Simulador mundial reforzado con física para manipulación robótica. El listado de arXiv indica GitHub y project website asociados.

Resultado con fuente enlazada · v1
#91 · RAG · EVALUACIÓN

AGE

Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.

Resultado con fuente enlazada · v1
#96 · AGENTES · EVALUACIÓN · CODING

A²utoLPBench

Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.

Resultado con fuente enlazada · v1
#108 · MULTIMODAL · MODELOS PEQUEÑOS

InternVLA-A1.5

Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.

Resultado con fuente enlazada · v1
#110 · EVALUACIÓN · SEGURIDAD · MULTIMODAL

Pluralis v0.1

Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.

Resultado con fuente enlazada · v1
#111 · AGENTES · EVALUACIÓN

LongMedBench

Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.

Resultado con fuente enlazada · v2

M3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal. Contiene 16.276 preguntas y soporta ediciones únicas y secuenciales.

Resultado con fuente enlazada · v1
#121 · SEGURIDAD · MULTIMODAL

OvisOCR2 Technical Report

Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.

Resultado con fuente enlazada · v1
#135 · MULTIMODAL · MODELOS PEQUEÑOS

Scaling Native Multimodal Pre-Training From Scratch

Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.

Resultado con fuente enlazada · v1

Analiza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios. Incluso modelos avanzados introducen afirmaciones no respaldadas. Su enfoque catch-n-repair detecta turnos infieles y los reescribe manteniendo la conversación.

Resultado con fuente enlazada · v1
#143 · MEMORIA · AGENTES · EVALUACIÓN

TransMem

TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.

Resultado con fuente enlazada · v1
#148 · AGENTES · SEGURIDAD · MULTIMODAL

Piggybacking on Perception

Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.

Resultado con fuente enlazada · v2
#36 · MULTIMODAL · EVALUACIÓN · HALLUCINATION

KnowHal

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

Resultado con fuente enlazada · v1
#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN

TTT-Embed

TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.

Resultado con fuente enlazada · v1
#20 · MULTIMODAL · SAE · CONTROL

MMDiff

MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.

Resultado con fuente enlazada · v1
#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN

VibeLifeBench

El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.

Resultado con fuente enlazada · v1
#22 · MULTIMODAL · NEGOCIO · BENCHMARK

MBA

MBA-Bench reúne 30.000 muestras en seis dominios. El pipeline combina imagen, caption, consultas extraídas visualmente y evidencia de mercado recuperada de la web para producir ideas de negocio.

Resultado con fuente enlazada · v1
#158 · MEMORIA

ReWorld

Señal del scout sobre memoria de horizonte largo en un mundo interactivo.

Síntesis editorial; ampliar lectura · por verificar
#31 · DISCOVERY · RECOMENDACIÓN · AGENTES

Shape Your Feed

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

Resultado con fuente enlazada · v1
#41 · MEMORIA

REAL

Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.

Resultado con fuente enlazada · v1
#75 · AGENTES · MULTIMODAL

CPAgents

Sistema de tres agentes —Analyst, Proposer, Verifier— para descubrir fenotipos cardiovasculares compuestos e interpretables. En cohortes de imagen cardiaca, sus variables compuestas superan a baselines en 56 de 72 combinaciones métrica-enfermedad.

Resultado con fuente enlazada · v1
#106 · MEMORIA

MILES

Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.

Resultado con fuente enlazada · v1
#117 · MEMORIA · AGENTES · MULTIMODAL

PalmClaw

En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

Resultado con fuente enlazada · v1

Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.

Resultado con fuente enlazada · v3
#127 · MULTIMODAL

BadWAM

Cuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina. Introduce ataques que, mediante pequeñas perturbaciones visuales, desacoplan la predicción del mundo futuro de la acción que finalmente ejecuta el robot.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué parte de la decisión requiere realmente combinar modalidades?

INPUT: Tareas con ablations de texto, imagen, vídeo y contexto temporal/espacial.

MÉTRICA: accuracy por modalidad, coste, latencia y errores de grounding

REGLA DE PARADA: Parar si una modalidad aumenta complejidad sin aportar evidencia adicional.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP