# Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/ring-zero-scaling-zero-rl-to-a-trillion-parameters-for-emergent-reasonin
- Fuente primaria: https://arxiv.org/html/2607.12395v1
- Versión leída: v2
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Xinyu Tang, Qianggang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
- Fecha del corte: 14 JULIO 2026.
- Área: IA APLICADA · EVALUACIÓN

## Tesis y contexto

Lleva RL con recompensas verificables y sin datos humanos anotados hasta un modelo de 1T de parámetros. Los autores describen dos fases de aprendizaje —descubrimiento y posterior refinamiento— y observan aparición espontánea de auto-verificación, razonamiento paralelo, formato estructurado y profundidad de razonamiento adaptativa.

- Problema: Buena parte de lo que sabemos sobre «Zero RL» proviene de modelos considerablemente más pequeños.
- Por qué importa: Si los resultados se reproducen, fortalece la tesis de que determinadas capacidades de razonamiento emergen al combinar escala y señales verificables, reduciendo la necesidad de diseñar manualmente heurísticas de pensamiento.

## Evidencia reportada

- **reported-result**: Table 1 presents the main results comparing our Ring-2.5-1T-Zero models against state-of-the-art proprietary models across various mathematical reasoning benchmarks. [localizador](https://arxiv.org/html/2607.12395#S4)
- **reported-result**: Zero RL achieves competitive reasoning from scratch. [localizador](https://arxiv.org/html/2607.12395#S4)
- **reported-result**: Without relying on any human-annotated data, Ring-2.5-1T-Zero (First Stage RL) already achieves an impressive 84.2% accuracy on AIME 2026. [localizador](https://arxiv.org/html/2607.12395#S4)
- **reported-result**: Multi-stage training yields consistent improvement. [localizador](https://arxiv.org/html/2607.12395#S4)

## Lectura y límite

- Método: La lectura de 3 Methodology describe la intervención y su construcción: In this section, we present a training framework that elicits and scales reasoning capabilities directly from a base model without relying on human-annotated data. A core design principle of our framework is minimalism . Guided by our finding that overly complex algorithmic designs are often unnecessary, we only introduce optimization elements when they are strictly required to guide the model’s iterative learning. We first outline the multi-stage training pipeline (Section 3.1 ), which progressively builds reasoning capabilities through three RL stages and an intermediate self-distillation phase. Subsequently,…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: \bullet Finally, and most strikingly, we observe the spontaneous emergence of highly complex cognitive strategies. While previous RL models exhibited basic self-reflection, Ring-2.5-1T-Zero progresses to much more sophisticated thinking mechanisms, obviating the need for complex, hand-crafted reasoning pipelines. Driven entirely by our self-iterative training process without human-annotated data, the model autonomously converges on five advanced emergent…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/html/2607.12395v1): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2607.12395): tipo abstract
- [Método · 3 Methodology](https://arxiv.org/html/2607.12395#S3): tipo section
- [Evaluación · 4 Experiments](https://arxiv.org/html/2607.12395#S4): tipo section
- [Cierre · 5 Discussion](https://arxiv.org/html/2607.12395#S5): tipo section
- [HTML · fuente navegable](https://arxiv.org/abs/2607.12395v1): tipo abstract

## Próxima prueba

- ¿La propuesta mejora matemáticas frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://github.com/THUDM/slime](https://github.com/THUDM/slime)
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [SearchOS-V1](https://luiseduardodemiguel.com/research-ia/markdown/papers/searchos-v1-towards-robust-open-domain-information-seeking-agent-collabo)
- [SEED](https://luiseduardodemiguel.com/research-ia/markdown/papers/seed-self-evolving-on-policy-distillation-for-agentic-reinforcement-lear)
- [AgentCompass](https://luiseduardodemiguel.com/research-ia/markdown/papers/agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities)