Lo esencial antes de invertir más tiempo.
Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.
Q2: Does UFP4 reduce the BF16-relative training loss gap?
Resultado reportado con fuente enlazada · 5 localizadores disponibles.La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.
Qué está reportado y qué conviene comprobar.
Q2: Does UFP4 reduce the BF16-relative training loss gap?
contexto: 5 Experiments
For linear_fc1 , RHT is relatively benign on the forward GEMM but exposes format-dependent degradation on backward paths: E1M2 preserves or improves output SQNR, whereas E2M1 loses SQNR after rotation ( Figure 6 ).
contexto: 5 Experiments
For linear_fc2 , the inversion is stronger: E1M2 converts post-RHT bucket utilization into higher output SQNR, while E2M1 often degrades after rotation ( Figure 7 ).
contexto: 5 Experiments
Across all three settings, UFP4 stays closer to BF16 ( Figure 8 ): latest-1000-step relative error drops from 1.2570% to 0.9673% on Dense 1.5B, from 2.3596% to 1.8469% on MoE 7.9B, and from 1.7308% to 1.3863% on MoE 124B.
1.2570% · contexto: 5 Experiments
Qué estudiaron y qué cambia.
La síntesis está separada de los resultados reportados y de las inferencias.PROBLEMA / La señal entra en el radar porque FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.
MÉTODO / La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then: [Fuente: https://arxiv.org/html/2606.20381#S2]
RESULTADO / La sección 5 Experiments informa: Q2: Does UFP4 reduce the BF16-relative training loss gap? For linear_fc1 , RHT is relatively benign on the forward GEMM but exposes format-dependent degradation on backward paths: E1M2 preserves or improves output SQNR, whereas E2M1 loses SQNR after rotation ( Figure 6 ). For linear_fc2 , the inversion is stronger: E1M2 converts post-RHT bucket utilization into higher output SQNR, while E2M1 often degrades after rotation ( Figure 7 ). [Fuente: https://arxiv.org/html/2606.20381#S5]
LÍMITE / El cierre de la fuente señala: This shows that even small per-GEMM multiplicative losses add in the exponent. Consequently, a weak but consistently positive \delta_{k} can produce a visible cumulative decay over long computation paths. La transferencia a entrenamiento LLM requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.20381#S7].
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- PROBLEMA
- FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.
- MÉTODO
- La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then:
- TIPO DE EVIDENCIA
- La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.20381#S5.
- LÍMITE
- La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
La lectura también deja rastro.
Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then:
Si funciona, baja costes de pretraining y acerca modelos grandes a más actores.
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
Cómo lo llevaría a un proyecto
Probar la propuesta en entrenamiento LLM reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
Preguntas que conviene probar
- ¿La mejora se mantiene cuando entrenamiento LLM cambia de dominio o distribución?
- ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
Si tuviera que convertirlo en una prueba mañana.
Mi lectura
La pregunta operativa es si entrenamiento LLM puede medirse con una línea base y un criterio de parada claros.
Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.