NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 14

MULTIMODAL · EVALUACIÓN · HALLUCINATION

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

InteresanteLectura primaria completa

Un modelo puede ver bien una imagen y aun así inventar conocimiento o aceptar una premisa falsa sobre ella.

AUTHORS / LABRuihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li y Yuntao Du
FECHA04 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

EVIDENCIA DISPONIBLE

KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías, y evalúa 14 MLLMs; knowledge hallucination aparece como la dimensión más difícil.

Resultado reportado con fuente enlazada · 3 localizadores disponibles.
LÍMITE

El benchmark mide una selección controlada de imágenes y preguntas; un mejor resultado no resuelve por sí solo grounding, calibración o seguridad en flujos visuales abiertos.

SIGUIENTE PRUEBA

Precisión de citas, calibración, tasa de abstención correcta y rendimiento por dominio/dimensión.

EN UNA FRASE

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

SEÑALMultimodal · Evaluación · Grounding
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías, y evalúa 14 MLLMs; knowledge hallucination aparece como la dimensión más difícil.

1.800 muestras; 10 dominios; 50 categorías; 14 MLLMs · contexto: Benchmark KnowHal

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

KnowHal amplía la idea de hallucination multimodal. Detectar un objeto que no está en una imagen es solo una parte del problema; un modelo también puede percibir bien una escena y luego añadir conocimiento externo incorrecto, confundir atributos o aceptar una premisa falsa sobre algo que sí aparece.

El benchmark organiza preguntas positivas y negativas sobre imágenes y entidades compartidas y separa cuatro dimensiones: entidad, atributo, relación y conocimiento. La construcción combina asistencia de LLM, filtrado con CLIP y verificación humana, con 1.800 muestras de 10 dominios y 50 categorías.

Al evaluar 14 MLLMs, los autores encuentran que la dimensión de conocimiento suele ser la más difícil y que el rendimiento cae de forma notable ante preguntas negativas. Esa estructura emparejada importa porque mantiene la percepción visual constante y permite observar cuándo el error viene de aceptar una afirmación falsa.

Para un producto visual, la lección es convertir las premisas falsas en una parte normal del test. El límite es que un benchmark controlado no captura toda la distribución de imágenes, contexto y consecuencias; aun así, obliga a separar lo que el modelo observa, lo que infiere y lo que debería rechazar antes de actuar.

DECISIÓN RÁPIDAAñadir preguntas negativas y de conocimiento externo a cualquier evaluación visual, manteniendo la misma imagen para distinguir percepción, inferencia y aceptación de premisas falsas.
NO LO SOBREINTERPRETES

El benchmark mide una selección controlada de imágenes y preguntas; un mejor resultado no resuelve por sí solo grounding, calibración o seguridad en flujos visuales abiertos.

PROBLEMA
Los benchmarks suelen medir percepción visual y conocimiento externo por separado, dejando invisible el salto entre ver una escena y razonar falsamente sobre ella.
MÉTODO
Construye preguntas positivas y negativas emparejadas sobre imágenes y entidades, cubriendo cuatro dimensiones: entity, attribute, relation y knowledge, con filtrado CLIP y verificación humana.
TIPO DE EVIDENCIA
KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías; evalúa 14 MLLMs y encuentra que knowledge hallucination es la dimensión más difícil y que las preguntas negativas degradan notablemente el rendimiento.
LÍMITE
El benchmark mide una selección controlada de imágenes y preguntas; un mejor resultado no resuelve por sí solo grounding, calibración o seguridad en flujos visuales abiertos.
FIGURA DE LECTURA / MULTIMODALEntidad · atributo · relación · conocimiento
Abrir paper original ↗

Ver una imagen y saber qué afirmar sobre ella son capacidades distintas.

PERCIBIRQué aparece
INFERIRQué significa
RECHAZARPremisa falsa
PARA RECORDAR

Las preguntas negativas hacen visible si el modelo sabe abstenerse.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías; evalúa 14 MLLMs y encuentra que knowledge hallucination es la dimensión más difícil y que las preguntas negativas degradan notablemente el rendimiento.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Construye preguntas positivas y negativas emparejadas sobre imágenes y entidades, cubriendo cuatro dimensiones: entity, attribute, relation y knowledge, con filtrado CLIP y verificación humana.

QUÉ APORTA

Las preguntas negativas y la dimensión de conocimiento muestran una fragilidad más cercana a los asistentes visuales reales que detectar objetos inexistentes de forma aislada.

QUÉ NO PRUEBA

El benchmark mide una selección controlada de imágenes y preguntas; un mejor resultado no resuelve por sí solo grounding, calibración o seguridad en flujos visuales abiertos.

Cómo lo llevaría a un proyecto

Añadir preguntas negativas y de conocimiento externo a cualquier evaluación visual, manteniendo la misma imagen para distinguir percepción, inferencia y aceptación de premisas falsas.

QA multimodalInspecciónAsistentes visualesMedicinaRetail

Preguntas que conviene probar

  • ¿El modelo está viendo el atributo o completándolo con conocimiento previo?
  • ¿Qué tasa de rechazo correcta mantiene cuando la pregunta contiene una premisa falsa?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA200 casos holdout con y sin retrieval, evidencia anotada y una política explícita de abstención.
PREGUNTA¿Separar retrieval, evidencia y calibración permite reducir hallucination en los dominios más difíciles?
MÉTRICAPrecisión de citas, calibración, tasa de abstención correcta y rendimiento por dominio/dimensión.
PARADAParar si el peor dominio queda por debajo de 80% de recall o si la calibración no mejora frente al baseline.

Mi lectura

La evaluación visual madura cuando separa lo que el modelo percibe de lo que cree saber y de lo que debería rechazar.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.