# Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/earth-onevision-extending-remote-sensing-multimodal-large-language-model
- Fuente primaria: https://arxiv.org/abs/2606.10819
- Versión leída: v1
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li
- Fecha del corte: 9 JUNIO 2026.
- Área: RAG · EVALUACIÓN · MULTIMODAL

## Tesis y contexto

Modelo multimodal de teledetección de solo 2B parámetros que integra seis modalidades: óptica, SAR, infrarrojo, multiespectral, temporal y vídeo. Introduce un dataset de unas 34M parejas QA y logra resultados competitivos o SOTA frente a modelos de 4B–72B en varias tareas geoespaciales.

- Problema: Los modelos de visión-lenguaje para observación terrestre suelen estar fragmentados por sensor y tarea.
- Por qué importa: Señal fuerte de que modelos pequeños y especializados pueden superar a modelos grandes generalistas en dominios ricos en estructura física.

## Evidencia reportada

- **reported-result**: Earth-OneVision achieves 97.31% accuracy on WHU-RS19 [ 50 ] testset and 78.03% recall on BigEarthNet RGB [ 97 ] , surpassing EarthDial by 1.10% and 5.00%. [localizador](https://arxiv.org/html/2606.10819#S5)
- **reported-result**: On xBD [ 15 ] testset, Earth-OneVision achieves an average accuracy of 80.89%, outperforming EarthDial by 6.89%. [localizador](https://arxiv.org/html/2606.10819#S5)
- **reported-result**: On FMoW [ 99 ] temporal classification testset, Earth-OneVision achieves 73.63% accuracy, outperforming EarthDial by 3.60%, demonstrating consistent gains across scene, multi-label, and temporal classification settings. [localizador](https://arxiv.org/html/2606.10819#S5)
- **reported-result**: Earth-OneVision surpasses EarthDial on LEVIR-MCI [ 59 ] testset with 76.45% METEOR vs. [localizador](https://arxiv.org/html/2606.10819#S5)

## Lectura y límite

- Método: La lectura de Method describe la intervención y su construcción: Adapting a foundation MLLM to broad-spectrum RS interpretation requires overcoming three bottlenecks: single-point vision-language coupling, spatial-linguistic fragmentation, and cross-modality transfer gap. FGVLA routes multi-level encoder features into different LLM depths, as detailed in Section III-B . SLIS reformulates horizontal boxes, oriented boxes, and masks as autoregressive token sequences, as detailed in Section III-C . PCMA bridges the RS domain gap through staged training, as detailed in Section III-D . Earth-OneVision comprises four modules: visual encoder \mathcal{E} , full-granularity…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: This paper presents Earth-OneVision, a unified RS-MLLM that brings broad-spectrum earth observation interpretation under a single 2B-parameter autoregressive framework, spanning six sensor modalities and cross-sensor fusion across 9 task categories. Unlike existing RS-MLLMs, Earth-OneVision introduces FGVLA, SLIS, and PCMA to jointly resolve all three core bottlenecks within a single framework. For joint training across all modalities, MMRS-OneVision…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.10819): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.10819): tipo abstract
- [Método · Method](https://arxiv.org/html/2606.10819#S3): tipo section
- [Evaluación · Experiments](https://arxiv.org/html/2606.10819#S5): tipo section
- [Cierre · Conclusion](https://arxiv.org/html/2606.10819#S6): tipo section

## Próxima prueba

- ¿La propuesta mejora monitorización agrícola frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://huggingface.co/datasets/ikhado/GeoLlama_Instruct](https://huggingface.co/datasets/ikhado/GeoLlama_Instruct)
- [https://www.isprs.org/resources/datasets/benchmarks/UrbanSemLab](https://www.isprs.org/resources/datasets/benchmarks/UrbanSemLab)
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)

## Enlaces relacionados

- [SAG](https://luiseduardodemiguel.com/research-ia/markdown/papers/sag)
- [RAG-Stack](https://luiseduardodemiguel.com/research-ia/markdown/papers/rag-stack)
- [TTT-Embed](https://luiseduardodemiguel.com/research-ia/markdown/papers/ttt-embed)