Lo esencial antes de invertir más tiempo.
Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Meanwhile, open-ended tasks are evaluated using the exact-match metric against reference answers, whereas coding tasks are evaluated using the Pass@1 metric.
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Downstream Implications.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Qué está reportado y qué conviene comprobar.
Meanwhile, open-ended tasks are evaluated using the exact-match metric against reference answers, whereas coding tasks are evaluated using the Pass@1 metric.
contexto: 4 Downstream Implications
Specifically, images are partitioned into 32\times 32 patches and proportionally downscaled if the resulting grid exceeds the token budget.
contexto: 4 Downstream Implications
Although these queries are strictly text-based and lack visual input, incorporating multimodal tokens during pre-training yields substantial performance gains.
contexto: 4 Downstream Implications
As illustrated in Figure 9 , multimodal models ( r=0.3 ) consistently outperform text-only baselines ( r=0 ).
baseline: Comparación declarada en la sección de evaluación · contexto: 4 Downstream Implications
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque conocemos bastante las leyes de escalado del lenguaje, pero mucho menos las de modelos multimodales nativos.
MÉTODO / La lectura de 2 Preliminaries describe la intervención y su construcción: In this work, we revisit a fundamental problem in native multimodal pre-training: given a fixed computational budget C , how should resources be optimally allocated between the model size N (the number of activated non-embedding parameters) and the total number of training tokens D ? Furthermore, we investigate how this optimal trade-off is influenced by data composition, parameterized by the multimodal data ratio r . To formalize this problem, we model the final pre-training loss L(N,D) as a function of N and D . Using the standard approximation C=6ND , the computational budget is strictly determined by these… [Fuente: https://arxiv.org/html/2607.22043#S2]
RESULTADO / La sección 4 Downstream Implications informa: Meanwhile, open-ended tasks are evaluated using the exact-match metric against reference answers, whereas coding tasks are evaluated using the Pass@1 metric. Specifically, images are partitioned into 32\times 32 patches and proportionally downscaled if the resulting grid exceeds the token budget. Although these queries are strictly text-based and lack visual input, incorporating multimodal tokens during pre-training yields substantial performance gains. [Fuente: https://arxiv.org/html/2607.22043#S4]
LÍMITE / El cierre de la fuente señala: This section details the comprehensive per-benchmark results supporting the analyses presented in Section 4 , organized into three primary categories. First, we present the training dynamics of the A3B model, evaluating text and multimodal performance at successive pre-training token budgets across multimodal data ratios r\in\{0,0.1,0.2,0.3\} ( Tables 2 , 3 , 4 , 5 , 6 , 7 and 8 ). Second, we report the final text performance across the entire model… La transferencia a diseño de VLMs requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2607.22043#S6].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Downstream Implications.
- PROBLEMA
- Conocemos bastante las leyes de escalado del lenguaje, pero mucho menos las de modelos multimodales nativos.
- MÉTODO
- La lectura de 2 Preliminaries describe la intervención y su construcción: In this work, we revisit a fundamental problem in native multimodal pre-training: given a fixed computational budget C , how should resources be optimally allocated between the model size N (the number of activated non-embedding parameters) and the total number of training tokens D ? Furthermore, we investigate how this optimal trade-off is influenced by data composition, parameterized by the multimodal data ratio r . To formalize this problem, we model the final pre-training loss L(N,D) as a function of N and D . Using the standard approximation C=6ND , the computational budget is strictly determined by these…
- TIPO DE EVIDENCIA
- La sección 4 Downstream Implications informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22043#S4.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Downstream Implications.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Preliminaries describe la intervención y su construcción: In this work, we revisit a fundamental problem in native multimodal pre-training: given a fixed computational budget C , how should resources be optimally allocated between the model size N (the number of activated non-embedding parameters) and the total number of training tokens D ? Furthermore, we investigate how this optimal trade-off is influenced by data composition, parameterized by the multimodal data ratio r . To formalize this problem, we model the final pre-training loss L(N,D) as a function of N and D . Using the standard approximation C=6ND , the computational budget is strictly determined by these…
Podría influir directamente en cómo se diseñe la próxima generación de foundation models.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Downstream Implications.
Cómo lo llevaría a un proyecto
Probar la propuesta en diseño de VLMs reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando diseño de VLMs cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si diseño de VLMs puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.