Appearance
Alibaba Qwen3
Qwen3 是阿里云通义千问团队于 2025 年 4 月 28 日正式发布的大语言模型家族。它以混合推理模式 (思考/非思考切换)、119 种语言支持 和 完全开源的 Apache 2.0 协议 为主要特色,是当前开源模型生态中最重要的贡献之一。
发展历程
| 时间 | 事件 |
|---|---|
| 2025.04.28 | Qwen3 正式发布 |
| 2025.04 | 所有模型上线 Hugging Face 和 GitHub |
模型版本
Qwen3 提供了从 0.6B 到 235B 的全尺寸覆盖:
| 模型 | 参数 | 架构 | 定位 |
|---|---|---|---|
| Qwen3-235B-A22B | 235B 总参数 (22B 激活) | MoE | 旗舰模型 |
| Qwen3-32B | 32B | Dense | 高性价比干流模型 |
| Qwen3-30B-A3B | 30B 总参数 (3B 激活) | MoE | 轻量 MoE |
| Qwen3-14B | 14B | Dense | 中等规模 |
| Qwen3-8B | 8B | Dense | 边缘部署 |
| Qwen3-4B | 4B | Dense | 轻量级 |
| Qwen3-1.7B | 1.7B | Dense | 边缘设备 |
| Qwen3-0.6B | 0.6B | Dense | 移动端 |
核心能力
- 混合推理模式: 单一模型支持"思考模式"(深度推理)和"非思考模式"(快速响应)的动态切换
- Agent 能力: 原生支持工具调用、代码执行、多步骤任务规划
- 多语言: 支持 119 种语言和方言
- 代码能力: 在 LiveCodeBench 等编程基准上达到顶级水平
- 数学推理: 复杂数学问题求解能力突出
技术亮点
混合推理训练
Qwen3 的核心创新之一是在单一模型中同时训练了"思考"和"非思考"两种能力。用户可以通过特殊的控制 token 在两种模式之间切换,无需部署多个模型。
MoE + Dense 混合发布
Qwen3 同时提供了 MoE 和 Dense 两种架构的模型,让用户可以根据场景和资源选择最适合的方案。
Benchmarks 表现
| 基准测试 | Qwen3-235B-A22B | 说明 |
|---|---|---|
| MMLU-Pro | ~85+ | 知识理解 |
| LiveCodeBench | 顶级 | 编程能力 |
| AIME 2024/2025 | 数学竞赛级 | 数学推理 |
| 多语言 | 优秀 | 119 种语言支持 |
开源与可用性
- 开源协议: Apache 2.0 (完全开源,无限制商用)
- 下载: Hugging Face 和 GitHub 提供完整权重和训练代码
- API 服务: 阿里云百炼平台
- 社区: 活跃的开源社区支持
与其他模型的关系
- vs Llama 4: 两者都是 2025 年的开源 MoE 模型,Qwen3 语言支持更广
- vs DeepSeek-V3: 在多项基准上竞争激烈,Qwen3 在语言覆盖上更强
- vs GPT-4o: 在多项基准上接近或超越
参考来源
相关页面
- Alibaba — 阿里云 AI 生态
- DeepSeek-V3 — 同期竞品开源模型
- Meta Llama 4 — 同期竞品开源模型
- Mixture of Experts — MoE 架构