Appearance
空间智能:World Labs、3D 生成与物理世界理解
"视觉让我们感知世界,空间智能让我们理解世界。" — 李飞飞。2025 年,空间智能从学术概念走向产业前沿,成为继语言智能之后 AI 的下一个前沿领域。
什么是空间智能?
空间智能(Spatial Intelligence)是 AI 理解、推理和交互三维物理世界的能力。它超越了单纯的"看见"(计算机视觉),要求 AI 理解:
- 几何关系:物体之间的位置、距离、朝向
- 物理规律:重力、碰撞、材质、光照
- 场景语义:房间的功能、物体的用途
- 动态变化:时间维度上的场景演化
李飞飞将其定义为:"感知三维空间关系、在三维空间中行动、并据此进行推理的能力。"
核心方向
1. 3D 生成与重建
World Labs(李飞飞创办)
- 成立时间:2024 年;2025 年发布首款产品
- 技术:从单张图片生成可交互的 3D 世界
- 能力:输入一张照片,生成可探索的 3D 场景;保持物体一致性;支持相机控制
- 融资:累计融资超过 2.3 亿美元,估值超 10 亿美元
- 愿景:"让 AI 像人类一样理解和创造三维世界"
其他 3D 生成技术
| 技术/产品 | 机构 | 能力 |
|---|---|---|
| Gaussian Splatting | 社区 | 高质量实时 3D 渲染 |
| Meshy | Meshy | 文本/图像生成 3D 模型 |
| Tripo3D | VAST | 快速 3D 资产生成 |
| Rodin | 影眸科技 | 3D 生成与编辑 |
| Luma Genie | Luma | 神经辐射场 3D 场景 |
2. 世界模型(World Models)
世界模型是 AI 对物理世界的内部表征,能够预测行动的后果。
- Yann LeCun 的 JEPA:联合嵌入预测架构,通过预测来学习世界表征
- Google DeepMind:Genie 2 可生成交互式 3D 环境
- Sora 作为世界模拟器:OpenAI 认为 Sora 展现了初步的世界模型能力
- 物理引擎 + AI 混合:NVIDIA 的 Isaac Sim 结合物理仿真与 AI
3. 具身智能(Embodied AI)
将空间智能与物理身体结合,让 AI 在真实世界中行动。
- 人形机器人:Figure AI、Tesla Optimus、Boston Dynamics Atlas
- 机器人学习:从仿真到真实(Sim-to-Real)迁移
- 抓取与操作:空间理解 → 精确物理交互
- 导航:室内/室外自主导航需要深度空间理解
4. 自动驾驶中的空间智能
自动驾驶是最成熟的具身智能应用:
- 感知:3D 目标检测、占据网格预测
- 预测:其他交通参与者的行为预测
- 规划:在 3D 空间中规划安全路径
- 端到端方案:Tesla FSD、Waymo 的端到端驾驶模型
关键技术
神经辐射场(NeRF)与 3D Gaussian Splatting
- NeRF:用神经网络隐式表示 3D 场景,渲染质量高但速度慢
- 3D Gaussian Splatting:用 3D 高斯点云表示场景,实时渲染,2023 年后成为主流
- 应用:虚拟旅游、电商展示、游戏场景、数字孪生
多模态 3D 理解
- 点云 + 图像 + 文本:融合多种传感器数据理解 3D 场景
- 3D LLM:将 3D 场景编码为 token,用大模型进行推理
- 场景图(Scene Graph):结构化表示场景中的物体和关系
物理仿真
- 可微分物理引擎:支持梯度传播的物理仿真,用于 AI 训练
- NVIDIA Isaac:机器人仿真平台
- MuJoCo:开源物理引擎,广泛用于强化学习
竞争格局
| 方向 | 领先者 | 关键产品/技术 |
|---|---|---|
| 3D 世界生成 | World Labs | 可交互 3D 场景 |
| 3D 资产生成 | Tripo3D, Meshy | 文本/图像 → 3D 模型 |
| 世界模型 | Google DeepMind | Genie 2 |
| 具身智能 | Tesla, Figure AI | 人形机器人 |
| 自动驾驶 | Waymo, Tesla | FSD, Waymo Driver |
| 物理仿真 | NVIDIA | Isaac Sim |
关键趋势
- 从 2D 到 3D:视频生成模型(Sora)正在向 3D 世界生成进化
- 生成式 3D:3D 内容创作从手工建模转向 AI 生成
- 世界模型竞赛:各大 lab 竞相构建能预测物理世界动态的内部模型
- 仿真到真实:Sim-to-Real 迁移成为机器人学习的关键技术
- 空间计算设备:Apple Vision Pro、Meta Quest 等 XR 设备推动空间内容需求
应用场景
- 游戏与元宇宙:AI 生成 3D 场景和资产
- 建筑与室内设计:从草图生成 3D 方案
- 电商:3D 产品展示、虚拟试穿
- 机器人:自主导航、抓取、操作
- 自动驾驶:端到端感知-预测-规划
- 数字孪生:工厂、城市的实时 3D 数字副本
挑战
- 数据稀缺:3D 标注数据远少于 2D 图像
- 计算成本:3D 训练和渲染需要大量计算资源
- 物理准确性:生成场景的物理一致性仍不完美
- 实时性:复杂 3D 场景的实时交互仍有挑战
- 标准化:3D 数据格式和表示方法尚未统一
影响与展望
空间智能正在:
- 解锁 AI 的物理世界接口:从"数字智能"到"物理智能"
- 催生新产业:3D 内容生成、空间计算、具身智能
- 改变机器人范式:从预编程到自主学习
- 推动 XR 发展:高质量 3D 内容是空间计算的燃料
未来 12 个月的关键问题:World Labs 的产品能否达到商用质量?世界模型能否从游戏/仿真走向真实世界?
相关页面
- 2025 年 AI 关键趋势 — 2025 年 AI 关键趋势
- 2026 年 AI 趋势速览 — 2026 年 AI 趋势速览
- World Labs — World Labs 实体页面
- Embodied AI — 具身智能概念
- 视频生成革命 — 视频生成革命趋势
- NVIDIA — NVIDIA 实体页面
Sources
- World Labs announcement and demos, 2024-2025
- Fei-Fei Li TED talk on Spatial Intelligence, 2024
- Google DeepMind Genie 2 paper
- NVIDIA Isaac Sim documentation
- 3D Gaussian Splatting original paper