PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#43 · RAG · EVALUACIÓN · MULTIMODAL Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.
Resultado con fuente enlazada · v1Framework agentic para razonamiento espacial continuo con herramientas jerárquicas y memoria temporal sobre imágenes multi-vista y vídeo.
Resultado con fuente enlazada · v3#78 · IA APLICADA · EVALUACIÓN Simulador mundial reforzado con física para manipulación robótica. El listado de arXiv indica GitHub y project website asociados.
Resultado con fuente enlazada · v1Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.
Resultado con fuente enlazada · v1#96 · AGENTES · EVALUACIÓN · CODING Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.
Resultado con fuente enlazada · v1#108 · MULTIMODAL · MODELOS PEQUEÑOS Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.
Resultado con fuente enlazada · v1#110 · EVALUACIÓN · SEGURIDAD · MULTIMODAL Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.
Resultado con fuente enlazada · v1#111 · AGENTES · EVALUACIÓN Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.
Resultado con fuente enlazada · v2#112 · EVALUACIÓN · MULTIMODAL M3Bench evalúa si una corrección introducida en un modelo médico multimodal permanece precisa bajo variaciones de texto, imágenes, modalidades, protocolos y evolución temporal. Contiene 16.276 preguntas y soporta ediciones únicas y secuenciales.
Resultado con fuente enlazada · v1#121 · SEGURIDAD · MULTIMODAL Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.
Resultado con fuente enlazada · v1#135 · MULTIMODAL · MODELOS PEQUEÑOS Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Resultado con fuente enlazada · v1#140 · EVALUACIÓN · MULTIMODAL Analiza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios. Incluso modelos avanzados introducen afirmaciones no respaldadas. Su enfoque catch-n-repair detecta turnos infieles y los reescribe manteniendo la conversación.
Resultado con fuente enlazada · v1#143 · MEMORIA · AGENTES · EVALUACIÓN TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.
Resultado con fuente enlazada · v1#148 · AGENTES · SEGURIDAD · MULTIMODAL Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.
Resultado con fuente enlazada · v2#36 · MULTIMODAL · EVALUACIÓN · HALLUCINATION KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.
Resultado con fuente enlazada · v1#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.
Resultado con fuente enlazada · v1#20 · MULTIMODAL · SAE · CONTROL MMDiff compara un SAE de un modelo lingüístico base con su versión adaptada a multimodalidad. Aísla features modificadas, encuentra subconjuntos específicos de tarea y permite eliminarlas o dirigirlas causalmente.
Resultado con fuente enlazada · v1#21 · MEMORIA · PROACTIVIDAD · EVALUACIÓN El benchmark evalúa agentes durante jornadas simuladas con eventos que ocurren sin notificación. El agente debe mantener compromisos, recordar restricciones y detectar cuándo revisar de nuevo el mundo.
Resultado con fuente enlazada · v1#22 · MULTIMODAL · NEGOCIO · BENCHMARK MBA-Bench reúne 30.000 muestras en seis dominios. El pipeline combina imagen, caption, consultas extraídas visualmente y evidencia de mercado recuperada de la web para producir ideas de negocio.
Resultado con fuente enlazada · v1Señal del scout sobre memoria de horizonte largo en un mundo interactivo.
Síntesis editorial; ampliar lectura · por verificar#31 · DISCOVERY · RECOMENDACIÓN · AGENTES Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.
Resultado con fuente enlazada · v1Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.
Resultado con fuente enlazada · v1#75 · AGENTES · MULTIMODAL Sistema de tres agentes —Analyst, Proposer, Verifier— para descubrir fenotipos cardiovasculares compuestos e interpretables. En cohortes de imagen cardiaca, sus variables compuestas superan a baselines en 56 de 72 combinaciones métrica-enfermedad.
Resultado con fuente enlazada · v1Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
Resultado con fuente enlazada · v1#117 · MEMORIA · AGENTES · MULTIMODAL En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.
Resultado con fuente enlazada · v1Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Resultado con fuente enlazada · v3Cuestiona la idea de que un World-Action Model es seguro porque podemos inspeccionar el futuro que imagina. Introduce ataques que, mediante pequeñas perturbaciones visuales, desacoplan la predicción del mundo futuro de la acción que finalmente ejecuta el robot.
Resultado con fuente enlazada · v1