Appearance
Anthropic Claude 4
Claude 4 是 Anthropic 于 2025 年 5 月 22 日正式发布的最新模型家族,包括 Claude 4 Opus (顶级性能) 和 Claude 4 Sonnet (性能与成本平衡) 两个版本。Claude 4 代表了 Anthropic 在推理、编程和 Agent 能力上的重大飞跃。
发展历程
| 时间 | 事件 |
|---|---|
| 2025.05.22 | Claude 4 Opus 和 Sonnet 正式发布 |
| 2025.05 | 通过 API 和 Claude.ai 同步提供 |
模型版本
Claude 4 Opus
- 定位: Anthropic 当前最强大的模型
- 核心能力: 复杂推理、深度研究、高端编程、创意任务
- 扩展思考 (Extended Thinking): 支持深度推理模式,在回答前进行长时间的内部思考
- 定价: 高于 Sonnet,适合对性能要求极高的场景
Claude 4 Sonnet
- 定位: 性能与成本平衡的生产环境首选
- 核心能力: 在大多数任务上接近 Opus,但成本显著更低
- 推荐场景: 企业生产环境、高并发应用
核心能力
- 扩展思考模式: 用户可以启用"思考模式",让模型在回答前进行更深入的推理,类似于 Test-Time Compute / Inference-Time Scaling 的用户可控版本
- 编程能力: 在 SWE-bench 等真实代码任务上达到行业领先
- 工具使用: 改进的 Function Calling 和 Agent 工作流支持
- 安全性: 继续使用 Constitutional AI 和 RLHF 结合的对齐方法
Benchmarks 表现
| 基准测试 | Claude 4 Opus | Claude 4 Sonnet | 说明 |
|---|---|---|---|
| SWE-bench | 行业领先 | 优秀 | 真实软件工程 |
| GPQA (研究生科学) | 顶尖 | 强劲 | 科学推理 |
| MMLU | 高分 | 高分 | 知识理解 |
| 代码生成 | 顶级 | 优秀 | 编程任务 |
定价与可用性
- API: 按 token 计费,Opus 定价高于 Sonnet
- Claude Pro: 订阅用户可使用
- Claude Code: 作为编程工具提供
与其他模型的关系
- vs o3: 两者在推理和编程上直接竞争,分别代表两家公司的顶级能力
- vs Gemini 2.5 Pro: 三方在推理基准上形成三足鼎立
- vs Claude 3.5: 显著超越前代,特别是代码和推理方面
参考来源
相关页面
- Anthropic — Anthropic 公司概览
- Claude 3.5 — 前代 Claude 3.5
- Test-Time Compute / Inference-Time Scaling — 推理时计算范式
- Constitutional AI / RLAIF — Anthropic 的对齐方法论