Appearance
实时多模态 AI:GPT-4o 语音、Gemini Live 与低延迟交互革命
2025 年,AI 从"能看能听"进化为"实时看、实时听、实时说"。原生多模态架构和低延迟交互正在创造全新的人机交互范式。
从级联到原生:架构革命
旧范式:级联 Pipeline
传统语音交互采用三段式架构:
- ASR(语音识别):音频 → 文本
- LLM:文本 → 文本回复
- TTS(语音合成):文本 → 音频
问题:延迟高(通常 1-3 秒)、丢失语调和情感信息、无法生成非语言声音(笑声、叹息)
新范式:原生端到端
新一代模型直接处理音频/视频输入并生成音频/视频输出:
- 单模型:同时理解文本、图像、音频、视频
- 低延迟:平均响应时间降至 300ms 左右(接近人类对话)
- 丰富表达:可生成情感语调、非语言声音、打断和停顿
主要产品和玩家
OpenAI GPT-4o("omni")
- 发布时间:2024 年 5 月发布;高级语音模式 2024-2025 年逐步 rollout
- 核心能力:单一模型原生处理音频、视觉、文本;生成音频包含情感语调和非语言声音
- 延迟:约 320ms 平均音频响应时间
- 2025 更新:
- GPT-4o 视觉和音频质量提升
- ChatGPT 桌面应用支持屏幕共享
- 实时翻译、辅导、创意协作场景
- API:Realtime API 2024 年发布,2025 年降价
Google Gemini Live / Project Astra
- 发布时间:Gemini Live 2024 年 5 月;Project Astra 2024 年 5 月 demo
- 核心能力:对话式语音;屏幕/视觉理解;实时视频分析
- 2025 更新:
- Gemini 2.5 Flash 支持原生音频输出
- Live API 向开发者开放
- 与 Android 深度整合(Pixel、Samsung)
- Gemini 应用支持实时视频理解
- 差异化:移动端深度整合;设备端组件降低延迟
开源与新兴玩家
| 产品 | 公司 | 定位 | 状态 |
|---|---|---|---|
| Moshi | Kyutai(法国) | 开源实时语音 | 开源权重 |
| Ultravox | Fixie.ai | 开源语音模型 | API + 开源 |
| Hume AI EVI | Hume | 情感语音 AI | 生产级 |
| Cartesia Sonic | Cartesia | 快速语音合成 | 生产级 |
| ElevenLabs ConvAI | ElevenLabs | 语音 Agent | 快速增长 |
| Sesame | Sesame | 对话式语音 | 2025 年 demo 引发关注 |
技术突破
语音到语音模型(Speech-to-Speech)
- 定义:音频 → 音频,无需文本中间表示
- 领导者:GPT-4o audio、Moshi、Ultravox
- 权衡:可控性低于文本中间方案;评估更困难
低延迟视频理解
- 挑战:实时处理视频流
- 技术路径:
- 帧采样 + 高效编码器
- 流式架构(如 Qwen2.5-VL)
- 设备端 + 云端混合
- 产品:Gemini Live 视频、ChatGPT 桌面视觉
实时翻译与语音保留
- 技术:跨语言语音克隆,保留说话人音色和语调
- 应用:实时会议翻译、视频配音、语言学习
评估与挑战
评估困境
- 尚无标准基准:实时多模态评估高度碎片化
- 关键指标:
- TTFT(Time To First Token for audio):首音频延迟
- 交互自然度(MOS 评分)
- 打断处理能力
- 安全性:实时生成更难审核;需要新的安全架构
技术挑战
- 延迟与质量的权衡:更低延迟往往意味着更短的思考时间
- 长对话记忆:多轮对话中的上下文保持
- 噪声鲁棒性:真实环境(街道、餐厅)中的性能
- 多说话人场景:区分和追踪多个说话人
应用场景(2025)
- AI 导师与语言练习:自然语言对话练习、作业辅导
- 客服语音 Agent:替代传统 IVR 系统
- 实时翻译:保留语调的对话式翻译
- 无障碍辅助:视障人士的实时视频描述
- 游戏 NPC:与游戏角色的实时语音交互
- 心理健康支持:低门槛的语音倾诉(需严格监管)
关键趋势
- 延迟竞赛: sub-300ms 成为语音交互的准入门槛
- 开源追赶:Moshi、Ultravox 等开源模型正在缩小与闭源模型的差距
- 语音 Agent 创业潮:基于实时 API 的语音 Agent 公司爆发式增长
- 硬件整合:智能眼镜、耳机、汽车正在成为多模态 AI 的终端
- 监管关注:实时语音克隆和深度伪造引发政策制定者关注
影响与展望
实时多模态 AI 正在:
- 重新定义交互界面:从"打字"到"说话",从"阅读"到"观看"
- 降低使用门槛:不识字用户、儿童、老年人都能自然使用 AI
- 创造新市场:实时翻译、AI 陪伴、语音客服
- 带来新风险:实时 deepfake、语音欺诈、隐私侵犯
未来 12 个月的关键问题:开源实时多模态模型能否达到生产级质量?实时语音 Agent 的商业模式是什么?
相关页面
- 多模态统一模型趋势 — 多模态统一模型趋势
- 2025 年 AI 关键趋势 — 2025 年 AI 关键趋势
- 2026 年 AI 趋势速览 — 2026 年 AI 趋势速览
- OpenAI — OpenAI 实体页面
- Google DeepMind — Google DeepMind 实体页面
- GPT-4o — GPT-4o 概念页面
Sources
- OpenAI GPT-4o announcement, May 2024
- OpenAI Realtime API docs
- Google Gemini Live blog
- Kyutai Moshi GitHub
- Google Project Astra