Qwen3 (0.6B to 235B-A22B)
Eight open Apache 2.0 models, two MoE (235B-A22B, 30B-A3B) and six dense, with switchable thinking modes, 36T tokens and 119 languages.
Hybrid reasoning in one model (thinking toggle and thinking budget), pretraining on about 36T tokens (double Qwen2.5's 18T) across 119 languages and dialects. Alibaba claimed Qwen3-4B rivals Qwen2.5-72B-Instruct.
- Date
- Tuesday, 29 April 2025
- Lab
- Alibaba (Qwen)
- Kind
- open-weights
- Access
- open weights
Figures
| Measure | Value | Measured by |
|---|---|---|
| Pretraining tokens | ~36T, 119 languages Qwen2.5 used 18T; MoE 235B-A22B and 30B-A3B plus dense 32B/14B/8B/4B/1.7B/0.6B | company |
Wikipedia cites Reuters coverage dated 2025-04-29. Qwen3 base models were reused by other labs, e.g. DeepSeek-R1-0528-Qwen3-8B (2025-05-29). Updated 2507 versions followed in July 2025 (not yet verified here).
Sources
This record was checked against its sources on 6 October 2026. How we check