# MBA: Multimodal Benchmark and Agents for Real-World Business Ideation
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/mbabench
- Fuente primaria: https://arxiv.org/abs/2608.11616
- Versión leída: v1
- Fuente comprobada: 2026-08-20 · método, resultado y límites revisados; fuente primaria enlazada
- Autores: Hojun Choi, Jaeyo Shin, Suin Lee y Hyunjung Shim
- Fecha del corte: 12 AGO 2026
- Área: MULTIMODAL · NEGOCIO · BENCHMARK

## Tesis y contexto

MBA-Bench reúne 30.000 muestras en seis dominios. El pipeline combina imagen, caption, consultas extraídas visualmente y evidencia de mercado recuperada de la web para producir ideas de negocio.

- Problema: La ideación agentic se evalúa casi siempre sobre texto, aunque muchos indicios de oportunidad viven en espacios, productos, comercios y procesos físicos.
- Por qué importa: Abre una superficie interesante para scouting industrial, retail intelligence y análisis de lugares, siempre que la creatividad se someta después a verificación económica y operativa.

## Evidencia reportada

- **reported-result**: En MBA-Bench, MBA-b y MBA-k superan los baselines basados en captions en 63,9% y 77,1%, y los baselines multimodales en 25,6% y 35,8%, respectivamente. [localizador](https://arxiv.org/html/2608.11616v1#S4)

## Lectura y límite

- Método: Conecta imágenes, descripciones, consultas visuales y evidencia de mercado para producir hipótesis de negocio a partir de escenas del mundo físico.
- Límite: Una idea plausible puede estar saturada, ser inviable o no tener comprador. La percepción acelera el scouting, no sustituye la validación.
- Confianza editorial: Baja
- Limitación: La ideación se evalúa sobre muestras y evidencia web recuperada; una puntuación de preferencia no demuestra que una idea sea viable, novedosa en el mercado o accionable.
- Limitación: La comparación entre caption, multimodalidad y MBA puede estar afectada por el juez, la calidad de la imagen y la recuperación de contexto, no solo por la comprensión visual.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2608.11616): tipo abstract
- [HTML · fuente navegable](https://arxiv.org/html/2608.11616v1): tipo abstract
- [Proyecto · MBA](https://hchoi256.github.io/projects/mba/): tipo section
- [Evaluación MBA-Bench · §4](https://arxiv.org/html/2608.11616v1#S4): tipo section
- [HTML · fuente navegable](https://arxiv.org/html/2608.11616): tipo abstract

## Próxima prueba

- ¿La imagen aporta una señal verificable que mejora la hipótesis frente a texto solo, sin aumentar hechos inventados?
- Métrica: Grounding visual, accionabilidad, novedad, precisión de hechos y acuerdo entre revisores.
- Regla de parada: Parar si la condición multimodal no mejora 10 puntos el grounding o aumenta 5 puntos los hechos no verificables.

## Recursos reproducibles
- [Proyecto · MBA](https://hchoi256.github.io/projects/mba/)
- [Código · GitHub](https://github.com/hchoi256/mba)
- [Dataset · Hugging Face](https://huggingface.co/datasets/hchoi256/MBA-Bench)

## Enlaces relacionados

- [MMDiff](https://luiseduardodemiguel.com/research-ia/markdown/papers/mmdiff)
- [VibeLifeBench](https://luiseduardodemiguel.com/research-ia/markdown/papers/vibelifebench)
- [Mechanist](https://luiseduardodemiguel.com/research-ia/markdown/papers/mechanist)