AI Research Atlas

Qwen3 (0.6B to 235B-A22B)

Alibaba (Qwen) · 29 April 2025

Eight open Apache 2.0 models, two MoE (235B-A22B, 30B-A3B) and six dense, with switchable thinking modes, 36T tokens and 119 languages.

Hybrid reasoning in one model (thinking toggle and thinking budget), pretraining on about 36T tokens (double Qwen2.5's 18T) across 119 languages and dialects. Alibaba claimed Qwen3-4B rivals Qwen2.5-72B-Instruct.

Date
Tuesday, 29 April 2025
Lab
Alibaba (Qwen)
Kind
open-weights
Access
open weights

Figures

MeasureValueMeasured by
Pretraining tokens~36T, 119 languages
Qwen2.5 used 18T; MoE 235B-A22B and 30B-A3B plus dense 32B/14B/8B/4B/1.7B/0.6B
company

Wikipedia cites Reuters coverage dated 2025-04-29. Qwen3 base models were reused by other labs, e.g. DeepSeek-R1-0528-Qwen3-8B (2025-05-29). Updated 2507 versions followed in July 2025 (not yet verified here).

Sources

  1. qwenlm.github.io/blog/qwen3/
  2. en.wikipedia.org/wiki/Qwen

This record was checked against its sources on 6 October 2026. How we check

Related