NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 13

EVALUACIÓN

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

VigilarLectura primaria completa

Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.

AUTHORS / LABQian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou
FECHA18 JUNIO 2026.
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.

EVIDENCIA DISPONIBLE

Q2: Does UFP4 reduce the BF16-relative training loss gap?

Resultado reportado con fuente enlazada · 5 localizadores disponibles.
LÍMITE

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

SIGUIENTE PRUEBA

Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.

EN UNA FRASE

Analiza el sesgo de shrinkage en pretraining FP4 y propone una receta UFP4.

SEÑALinfra AI · chips
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

For linear_fc1 , RHT is relatively benign on the forward GEMM but exposes format-dependent degradation on backward paths: E1M2 preserves or improves output SQNR, whereas E2M1 loses SQNR after rotation ( Figure 6 ).

contexto: 5 Experiments

RESULTADO REPORTADO

For linear_fc2 , the inversion is stronger: E1M2 converts post-RHT bucket utilization into higher output SQNR, while E2M1 often degrades after rotation ( Figure 7 ).

contexto: 5 Experiments

RESULTADO REPORTADO

Across all three settings, UFP4 stays closer to BF16 ( Figure 8 ): latest-1000-step relative error drops from 1.2570% to 0.9673% on Dense 1.5B, from 2.3596% to 1.8469% on MoE 7.9B, and from 1.7308% to 1.3863% on MoE 124B.

1.2570% · contexto: 5 Experiments

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

PROBLEMA / La señal entra en el radar porque FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.

MÉTODO / La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then: [Fuente: https://arxiv.org/html/2606.20381#S2]

RESULTADO / La sección 5 Experiments informa: Q2: Does UFP4 reduce the BF16-relative training loss gap? For linear_fc1 , RHT is relatively benign on the forward GEMM but exposes format-dependent degradation on backward paths: E1M2 preserves or improves output SQNR, whereas E2M1 loses SQNR after rotation ( Figure 6 ). For linear_fc2 , the inversion is stronger: E1M2 converts post-RHT bucket utilization into higher output SQNR, while E2M1 often degrades after rotation ( Figure 7 ). [Fuente: https://arxiv.org/html/2606.20381#S5]

LÍMITE / El cierre de la fuente señala: This shows that even small per-GEMM multiplicative losses add in the exponent. Consequently, a weak but consistently positive \delta_{k} can produce a visible cumulative decay over long computation paths. La transferencia a entrenamiento LLM requiere repetir la comparación con datos y criterios propios [Fuente: https://arxiv.org/html/2606.20381#S7].

DECISIÓN RÁPIDAProbar la propuesta en entrenamiento LLM reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.
NO LO SOBREINTERPRETES

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

PROBLEMA
FP4 promete abaratar entrenamiento, pero pequeños sesgos numéricos pueden degradar modelos a escala.
MÉTODO
La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then:
TIPO DE EVIDENCIA
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.20381#S5.
LÍMITE
La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

La lectura de 2 Preliminaries describe la intervención y su construcción: FP4 formats use one sign bit and split the remaining bits into exponent and mantissa fields, denoted E x M y . We consider two FP4 formats, E2M1 and E1M2, and an INT4 codebook ( Figure 1(a) ). In practice, blockwise quantization is widely adopted to improve precision by partitioning a tensor \mathbf{T} into contiguous blocks \{B\} and mapping each element to a codebook level under a shared per-block scale. Let G=\{g\} denote the normalized codebook of a chosen format, g_{\max}=\max_{g\in G}|g| its largest magnitude level, and \rho_{G} the rounding rule. The quantization process is then:

QUÉ APORTA

Si funciona, baja costes de pretraining y acerca modelos grandes a más actores.

QUÉ NO PRUEBA

La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

Cómo lo llevaría a un proyecto

Probar la propuesta en entrenamiento LLM reproduciendo primero la comparación y registrando calidad, coste, latencia y errores.

entrenamiento LLMhardware-aware trainingcuantizacióninfra cloud.

Preguntas que conviene probar

  • ¿La mejora se mantiene cuando entrenamiento LLM cambia de dominio o distribución?
  • ¿Qué componente del método explica la mayor parte del resultado y qué baseline lo pone realmente a prueba?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADAentrenamiento LLM con un conjunto pequeño de casos representativos y la misma métrica o protocolo que la fuente cuando sea reproducible.
PREGUNTA¿La propuesta mejora entrenamiento LLM frente a la línea base actual?
MÉTRICAComparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
PARADAParar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

Mi lectura

La pregunta operativa es si entrenamiento LLM puede medirse con una línea base y un criterio de parada claros.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.