Appearance
Google Gemini 2.5 Pro
Gemini 2.5 Pro 是 Google DeepMind 于 2025 年 3 月发布预览版、5 月正式发布的顶级推理模型。它以原生多模态架构、超长上下文窗口和强大的 Agent 能力为特色,是 Google 对标 OpenAI o3 和 Claude 4 的旗舰产品。
发展历程
| 时间 | 事件 |
|---|---|
| 2025.03.25 | 预览版发布 |
| 2025.05 | 正式发布 (GA) |
核心能力
- 原生多模态: 从底层架构支持文本、图像、音频、视频和代码的统一处理
- 超长上下文: 支持 100 万 token 的上下文窗口
- 思考模式 (Thinking): 内置推理能力,在回答前进行深度思考
- Agent 能力: 改进的工具使用和多步骤任务执行
- 编程能力: 在代码生成和软件工程任务上表现突出
技术亮点
原生多模态架构
与将不同模态的模型拼接在一起的方案不同,Gemini 2.5 Pro 从训练阶段就是一个统一的多模态模型。这使得它在跨模态任务(如视频理解、图文分析)上具有本质优势。
思考模式
类似于 Test-Time Compute / Inference-Time Scaling 的实现,Gemini 2.5 Pro 在复杂问题上会自动或手动启用思考模式,通过更多的内部计算提升回答质量。
Benchmarks 表现
| 基准测试 | 分数 | 说明 |
|---|---|---|
| MMLU | ~89.8% | 知识理解 |
| GPQA Diamond | ~84.0% | 研究生级科学问答 |
| AIME 2025 | ~86.3% | 数学竞赛 |
| 多模态理解 | 顶级 | 视频/图像/音频综合理解 |
定价与可用性
- Google AI Studio: 免费 tier 可用
- Vertex AI: 企业级 API,按 token 计费
- Gemini Advanced: 订阅用户可使用
与其他模型的关系
参考来源
相关页面
- Google — Google AI 生态概览
- Gemini 1.5 — 前代 Gemini 1.5
- Multimodal Models — 多模态模型技术
- Test-Time Compute / Inference-Time Scaling — 推理时计算