Skip to content

OpenAI o3

OpenAI o3 是 OpenAI 于 2024 年 12 月首次公布、2025 年 1 月正式通过 API 提供的顶级推理模型。它代表了 LLM 从"预测下一个 token"进化到"进行深度推理"的里程碑,是 Test-Time Compute / Inference-Time Scaling 范式的典型代表。

发展历程

时间事件
2024.12.20OpenAI 在 "12 Days of OpenAI" 活动第 12 天首次展示 o3
2025.01通过 ChatGPT Pro 和 API 正式提供
2025.04o4-mini 作为高效版本同期发布

核心能力

  • 深度推理: 在数学、物理学、化学等 STEM 领域的复杂问题上表现突出
  • 编程能力: 在 Codeforces 等竞赛级编程任务上达到全球前 200 名选手水平
  • 多模态输入: 支持文本和图像的联合推理
  • 审慎对齐 (Deliberative Alignment): 模型在回答前进行内部检查,确保输出符合安全准则

技术亮点

审慎对齐 (Deliberative Alignment)

o3 采用了一种新的安全训练方法:模型在生成回答前,会自动进行多步推理,评估潜在风险,并确保输出符合人类价值观。这使得 o3 在强化学习 (RL) 训练中能够更好地平衡能力与安全性。

Test-Time Compute 优化

与传统模型不同,o3 在推理阶段会投入更多计算资源,通过"思考更久"来提升输出质量。这是 Test-Time Compute / Inference-Time Scaling 范式的典型实践——不再只追求更大的训练规模,而是让模型在回答时"想得更深入"。

Benchmarks 表现

基准测试分数说明
AIME 2024~96.7%美国数学邀请赛,接近满分
GPQA Diamond~87.7%研究生级科学问答
Codeforces Rating~2727竞赛编程平台,相当于全球前 200 名
SWE-bench Verified顶尖真实软件工程任务

定价与可用性

  • ChatGPT Pro: $200/月 订阅用户可用
  • API: 按 token 计费,属于高价位 API 层级
  • 限制: 目前仅对高级订阅和企业 API 用户开放

与其他模型的关系

  • vs GPT-4o: o3 在推理任务上显著强于 GPT-4o,但通用任务和多模态能力与 GPT-4o 相当
  • vs DeepSeek-R1: 两者都是推理模型的代表,分别代表闭源和开源路线
  • vs Claude 4: 两者在推理和编程能力上直接竞争

参考来源

相关页面

AI Knowledge Base — 持续积累