# KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/knowhal
- Fuente primaria: https://arxiv.org/abs/2608.03782
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li y Yuntao Du
- Fecha del corte: 04 AGO 2026
- Área: MULTIMODAL · EVALUACIÓN · HALLUCINATION

## Tesis y contexto

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

- Problema: Los benchmarks suelen medir percepción visual y conocimiento externo por separado, dejando invisible el salto entre ver una escena y razonar falsamente sobre ella.
- Por qué importa: Las preguntas negativas y la dimensión de conocimiento muestran una fragilidad más cercana a los asistentes visuales reales que detectar objetos inexistentes de forma aislada.

## Evidencia reportada

- **reported-result**: KnowHal contiene 1.800 muestras en 10 dominios y 50 categorías, y evalúa 14 MLLMs; knowledge hallucination aparece como la dimensión más difícil. [localizador](https://arxiv.org/html/2608.03782v1#S3)

## Lectura y límite

- Método: Construye preguntas positivas y negativas emparejadas sobre imágenes y entidades, cubriendo cuatro dimensiones: entity, attribute, relation y knowledge, con filtrado CLIP y verificación humana.
- Límite: El benchmark mide una selección controlada de imágenes y preguntas; un mejor resultado no resuelve por sí solo grounding, calibración o seguridad en flujos visuales abiertos.
- Confianza editorial: Alta
- Limitación: El benchmark contiene 1.800 muestras, 10 dominios y 14 MLLMs; la cobertura de conocimiento, idioma y dificultad puede no representar despliegues reales.
- Limitación: Knowledge hallucination es una dimensión compuesta: un fallo puede venir de retrieval, razonamiento, calibración o falta de abstención, y la etiqueta no separa siempre esas causas.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.03782): tipo abstract
- [Benchmark y dimensiones · HTML](https://arxiv.org/html/2608.03782v1#S3): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.03782): tipo abstract

## Próxima prueba

- ¿Separar retrieval, evidencia y calibración permite reducir hallucination en los dominios más difíciles?
- Métrica: Precisión de citas, calibración, tasa de abstención correcta y rendimiento por dominio/dimensión.
- Regla de parada: Parar si el peor dominio queda por debajo de 80% de recall o si la calibración no mejora frente al baseline.

## Recursos reproducibles
- [HTML · fuente navegable](https://arxiv.org/html/2608.03782v1)

## Enlaces relacionados

- [MMDiff](https://luiseduardodemiguel.com/research-ia/markdown/papers/mmdiff)
- [MBA](https://luiseduardodemiguel.com/research-ia/markdown/papers/mbabench)
- [VibeLifeBench](https://luiseduardodemiguel.com/research-ia/markdown/papers/vibelifebench)