Appearance
OpenAI o3
OpenAI o3 是 OpenAI 于 2024 年 12 月首次公布、2025 年 1 月正式通过 API 提供的顶级推理模型。它代表了 LLM 从"预测下一个 token"进化到"进行深度推理"的里程碑,是 Test-Time Compute / Inference-Time Scaling 范式的典型代表。
发展历程
| 时间 | 事件 |
|---|---|
| 2024.12.20 | OpenAI 在 "12 Days of OpenAI" 活动第 12 天首次展示 o3 |
| 2025.01 | 通过 ChatGPT Pro 和 API 正式提供 |
| 2025.04 | o4-mini 作为高效版本同期发布 |
核心能力
- 深度推理: 在数学、物理学、化学等 STEM 领域的复杂问题上表现突出
- 编程能力: 在 Codeforces 等竞赛级编程任务上达到全球前 200 名选手水平
- 多模态输入: 支持文本和图像的联合推理
- 审慎对齐 (Deliberative Alignment): 模型在回答前进行内部检查,确保输出符合安全准则
技术亮点
审慎对齐 (Deliberative Alignment)
o3 采用了一种新的安全训练方法:模型在生成回答前,会自动进行多步推理,评估潜在风险,并确保输出符合人类价值观。这使得 o3 在强化学习 (RL) 训练中能够更好地平衡能力与安全性。
Test-Time Compute 优化
与传统模型不同,o3 在推理阶段会投入更多计算资源,通过"思考更久"来提升输出质量。这是 Test-Time Compute / Inference-Time Scaling 范式的典型实践——不再只追求更大的训练规模,而是让模型在回答时"想得更深入"。
Benchmarks 表现
| 基准测试 | 分数 | 说明 |
|---|---|---|
| AIME 2024 | ~96.7% | 美国数学邀请赛,接近满分 |
| GPQA Diamond | ~87.7% | 研究生级科学问答 |
| Codeforces Rating | ~2727 | 竞赛编程平台,相当于全球前 200 名 |
| SWE-bench Verified | 顶尖 | 真实软件工程任务 |
定价与可用性
- ChatGPT Pro: $200/月 订阅用户可用
- API: 按 token 计费,属于高价位 API 层级
- 限制: 目前仅对高级订阅和企业 API 用户开放
与其他模型的关系
- vs GPT-4o: o3 在推理任务上显著强于 GPT-4o,但通用任务和多模态能力与 GPT-4o 相当
- vs DeepSeek-R1: 两者都是推理模型的代表,分别代表闭源和开源路线
- vs Claude 4: 两者在推理和编程能力上直接竞争
参考来源
相关页面
- Test-Time Compute / Inference-Time Scaling — o3 的核心训练范式
- Chain-of-Thought & Reasoning — 推理模型的基础技术
- OpenAI — OpenAI 公司概览
- GPT-4o — 前代通用模型