Appearance
Chroma
Chroma 是由 Chroma Inc. 开发的嵌入式向量数据库,成立于 2022 年,创始人是 Jeff Huber(CEO)和 Anton Troynikov(CTO)。它以"pip install 即可用"的极简体验、本地优先哲学和与 LLM 框架的深度集成,成为 AI 应用原型开发阶段最受欢迎的向量存储选择。
核心定位
Chroma 的定位是AI 应用的默认数据层。它不追求十亿级规模的极致性能,而是专注于让开发者在 5 分钟内为 LLM 应用添加记忆(memory)和上下文检索能力。
关键特性
| 特性 | 说明 |
|---|---|
| 极简 API | collection.add() / collection.query() 即可完成功能 |
| 原生 embedding | 内置 embedding 函数,自动将文档转为向量,无需手动调用 API |
| 本地优先 | 默认 SQLite 后端,pip 安装后本地运行,无需网络 |
| 多后端支持 | DuckDB(分析型)、SQLite(嵌入式)、PostgreSQL(生产级) |
| 文档存储 | 文档、embedding、元数据一体化存储 |
| 框架集成 | 与 LangChain、LlamaIndex、OpenAI、Vercel AI SDK 深度集成 |
架构要点
- 开源(Apache 2.0):核心完全开源
- 轻量级:无外部依赖,单进程运行
- 可插拔 embedding:支持 OpenAI、HuggingFace、Cohere、Ollama 等 embedding 模型
- 存储后端切换:开发用 SQLite/DuckDB,生产切换到 PostgreSQL
- Chroma Server:可选的独立服务模式,支持远程客户端连接
- 无内置分布式:单节点架构,通过外部 PostgreSQL 实现扩展
主要应用场景
- LLM 应用原型:为 ChatBot、文档问答快速添加向量记忆
- 本地 AI:配合 Ollama、LM Studio 等工具构建完全离线的 RAG 应用
- 中小规模 RAG:10K-10M 向量范围内的文档检索系统
- 内部工具:企业内部的智能搜索、知识库助手
融资与商业
- 累计融资约 1,800 万美元(Seed $2M,Series A $18M)
- 采用开源核心 + 未来云托管商业化的路线
- 在开发者社区中增长迅速,GitHub 星标持续攀升
差异化优势与局限
| 优势 | 局限 |
|---|---|
| 所有向量数据库中上手最简单 | 不适合十亿级大规模场景 |
| 本地运行,隐私性好 | 无内置分布式/集群能力 |
| 与 LLM 框架集成最紧密 | 性能不及 Qdrant、Milvus 等专用引擎 |
| 多后端灵活切换 | 高级查询功能(混合搜索、图查询)缺失 |
适用规模建议
| 数据规模 | 推荐后端 | 适用场景 |
|---|---|---|
| < 100K | SQLite | 原型、本地应用 |
| 100K - 10M | DuckDB | 分析型工作负载 |
| > 10M | PostgreSQL | 生产级部署 |
| > 100M | 考虑迁移至 Milvus/Qdrant | 超大规模 |