Mixedbread AI Search API 2026 评测:Modern ColBERT 定价与 RAG 适配度

Hugging Face 上周发布 Sentence Transformers v6.0,新增面向 ColBERT 式后期交互检索的 MultiVectorEncoder 之后,整个 RAG 圈子对「什么才是好的检索」的讨论,已经明显转向多向量、后期交互。而生产环境里最能代表这套技术的公司之一,就是 Mixedbread AI — 来自柏林/旧金山的团队,开源了下载量超 5000 万的 mxbai 嵌入与重排模型。它的托管产品 Mixedbread Search APIModern ColBERT 支撑 25 亿+ 文档、每秒 1 万+ 查询,并在 BrowseComp-Plus 检索基准上排名第一。本文评测 Mixedbread Search 到底做什么、Verified 定价(索引/搜索/存储 + Toast 1 搜索模型)、mxbai 模型家族,以及它能否进入你的 RAG 技术栈。

🌍 快速结论:Mixedbread Search API 是一层托管检索层 — 上传 PDF、图片、代码、视频,返回语义检索与重排结果,无需自己跑嵌入模型或向量数据库。对 RAG 团队来说,它把「嵌入 + 索引 + 重排」整条管线都省了。按量计费且可免费起步:$5 一次性额度(无需信用卡),之后 Scale $20/月 + 按量,索引 $1.50–$3/百万内容 token,语义查询 $4/千次(重排 +$3.50),存储 $0.50/百万内容 token/月。取舍在于:它是封闭托管平台,无法自托管整套检索栈,大陆直连需要代理。

Mixedbread Search API 到底是什么

Mixedbread 的定位是「你的数据的搜索 API」。与其自己管嵌入模型和向量数据库,你创建一个 Store(Mixedbread 对搜索索引的称呼),上传任意文件格式 — PDF、图片、文档、代码、视频、表格 — 然后用自然语言查询。平台内部处理 OCR、分块、嵌入与重排。从文档与更新日志验证到的核心能力:

  • 一个 API,全模态:文本、PDF、表格、图片、音频、视频搜索,覆盖 100+ 语言,无需自建文档解析管线。
  • 底层是 Modern ColBERT:后期交互多向量检索,与 SBERT v6.0 新开的 MultiVectorEncoder 同属一类。Mixedbread 已在生产规模化:25 亿+ 文档、每秒 1 万+ 查询BrowseComp-Plus 排名第一
  • Agentic 检索与流式:2026-08-19 起,Agentic Search 可流式输出 server-sent 追踪事件,让 agent 实时观察检索过程。
  • Bring Your Own Bucket:源数据留在你拥有的对象存储里,Mixedbread 内存索引并在你的桶里持久化所有产物,其基础设施不保留任何内容。

这与传统的「嵌入 API(发文本、回向量)」或「向量数据库(存向量、做 ANN)」是不同模式。Mixedbread 把整条链路收进一个「上传即问」的界面 — 如果你想做托管 RAG 产品,这正合适;如果你只需要原始嵌入向量,就有点杀鸡用牛刀。

Verified 定价(mixedbread.com/pricing,2026-08-24)

Mixedbread 按用量分三块计费 — 索引、搜索、存储 — 外加其 Toast 1 搜索模型按 token 的 LLM 费率。没有「每条嵌入多少钱」,因为嵌入在平台内部处理。以下费率均来自在线的定价页。

模块模式 / 模型价格备注
索引Fast$1.50 / 百万内容 token内容感知分词
索引High Quality$3.00 / 百万内容 tokenOCR、转写、摘要、多模态增强
搜索Grep$0.10 / 千次查询精确 / 正则匹配
搜索Semantic$4.00 / 千次查询细粒度语义检索;重排 +$3.50/千次
搜索Toast 1$1.00 / 千次查询前沿搜索模型;重排 +$1.50/千次
存储按 token 月费$0.50 / 百万内容 token / 月让已索引数据随时可检索
LLM token(Toast 1)输入$0.50 / 百万(发布价 $0.30)面向知识任务的专用搜索模型
LLM token(Toast 1)缓存输入$0.06 / 百万(发布价 $0.036)缓存写入免费
LLM token(Toast 1)输出$1.20 / 百万(发布价 $0.72)发布期 40% 折扣

套餐很简单:Starter$5 一次性额度、无需信用卡、3 个工作区用户、10 个 Store、每分钟 100 次请求 — 足够评估真实语料。Scale$20/月 + 按量,采用上述费率,限额更高、席位更多、优先支持。企业版(更高限额、定制模型、自托管选项)走商务报价。

mxbai 模型家族与 Toast 1

Mixedbread 的开源权重是其托管平台的「回程路」。最常用的是 mxbai-embed-large-v1(1024 维嵌入模型,可随处运行)以及重排器 mxbai-rerank-base-v2mxbai-rerank-large-v2 和更新的 mxbai-rerank-xsmall-v1。它们都是 mixedbread-ai 组织下的开源权重。

2026 年的两次发布对当下 RAG 选型很重要:

  • mxbai-rerank-v3.1-listwise(2026-07-27)— 现为 Mixedbread Search 的默认重排器。达到 GPT-5.6 Sol 级重排质量,延迟比上一代低约 25–54%。「Listwise」指它把候选列表作为一个整体打分,而不是逐条独立打分 — 对 Top-N 重排是个实实在在的质量优势。
  • Toast 1(2026-08-13)— 与 Mixedbread Search 联合设计的专用搜索模型。按更新日志,它在知识工作上匹配或超过 Claude Opus 5 与 GPT-5.6 Sol,同时便宜最多 10 倍、快 12 倍。它通过 Mixedbread 的 Chat Completions API 暴露,按 LLM token 计费(即上面的 $0.50/$1.20 输入/输出)。

文档里还提到 Wholembed v3 查询引擎(2026-07-31 更新),把查询编码 p50 延迟降低 39%、端到端搜索 p50 延迟降低 21% — 这是平台能撑住每秒 1 万+ 查询的引擎级原因。

它在 SBERT v6.0 多向量时代的定位

Sentence Transformers v6.0 发布在 dense、sparse、reranker 之外新增了第四种模型类型 — MultiVectorEncoder。它可以直接加载任何 PyLate checkpoint、任何 Stanford-NLP ColBERT checkpoint,以及用于视觉文档检索的 colpali-engine 模型,走同一个熟悉的 API。对自托管者来说,这意味着 ColBERT 式后期交互检索(每篇文档多个向量,与多个查询向量匹配,用 MaxSim 打分)现在是一等公民、容易跑起来的能力。

Mixedbread 是托管版的故事:它在生产环境跑后期交互检索(「Modern ColBERT」)多年,所以不想自托管 v6.0 MultiVectorEncoder 的团队,可以用托管 API 获得同一类检索。这对 RAG 构建者形成的现实选择:

方案适合场景成本画像
自托管 SBERT v6.0 MultiVectorEncoder + 向量库要完全掌控、离线/内网、或要横向扩展嵌入 + ANN 基建GPU 成本 + 存储;已有推理则算力免费
托管检索(Mixedbread Search API)产品团队现在就要上线 RAG、多模态文件、没有运维预算搭检索栈存储 $0.50/百万 token/月 + 索引 $1.50–$3/百万 + 语义查询 $4/千次
混合:mxbai embed/rerank 开源权重 + 自建库要 Mixedbread 级嵌入但保留向量库与管线的自主权开源权重免费;自己跑嵌入 + 重排推理

想完整看嵌入生态的对比,可参考我们的 Voyage AI 评测Cohere 评测Weaviate(向量库)评测,用它们来对照 Mixedbread。

局限与坑

  1. 检索只能托管。完整 Search API(Modern ColBERT、Wholembed、多模态)是封闭平台。要自托管同一套检索栈,只能用开源 mxbai 权重,而不是托管引擎。
  2. 无中国大陆直连端点。Mixedbread 是美国/欧洲 API(法人实体 mixedbread ai inc.),大陆生产流量需要代理或中转,跨太平洋延迟。
  3. 搜索按查询计费而非按 token。语义查询 $4/千次对中等查询量很划算,但高频率搜索(每月上千万次查询)可能超出平价的「嵌入 + 数据库」方案 — 上线前先核算预期 QPS。
  4. 没有裸嵌入向量 API。如果只需要 1024 维向量并想自建索引,Mixedbread 托管产品做得更多(Store 化检索)也更贵。这种情况请用开源权重或专用嵌入 API。
  5. 发布价是临时的。Toast 1 的费率是 40% 折扣发布价($0.30/$0.036/$0.72 是头条价);常规价是 $0.50/$0.06/$1.20。按常规价做预算,别按发布价。

FAQ

Mixedbread 是向量数据库吗?不是 — Mixedbread Search 是包含存储的托管检索层。它的 Store 概念类似索引,但你的交互是「上传即搜」,而不是自己管向量、集合或 ANN 索引。Pinecone、Qdrant、Weaviate 这类专用向量库给你对索引的直接控制。

能在 Mixedbread 之外用 mxbai-embed-large-v1 吗?能。它是 Hugging Face 上的 Apache-2.0 开源权重,可跑在任何嵌入管线 — sentence-transformers、vLLM、llama.cpp,或你的向量库自带本地嵌入集成。

dense 与多向量(ColBERT)检索有什么区别?Dense 检索把整篇文档映射成一个向量,会丢失 token 级细粒度语义。多向量(后期交互)检索每篇文档存多个向量,用 MaxSim 对 token 匹配打分 — 在长文档、主题密集的检索上更准,代价是更多存储与算力。SBERT v6.0 的 MultiVectorEncoder 与 Mixedbread 的 Modern ColBERT 都是这种实现。

Mixedbread 对比 Jina / Voyage 的嵌入如何?Jina 和 Voyage 是嵌入 API 提供商:你发文本、回向量,然后自己跑 ANN 索引。Mixedbread 是「检索即服务」:嵌入、索引、检索、重排端到端。只要向量就选 Jina/Voyage(更轻);要整层搜索托管就选 Mixedbread。

总结

Mixedbread Search API 是目前市场上最强的托管「检索即服务」选项之一,而且正好处在 SBERT v6.0 多向量浪潮与生产 RAG 的交汇点。它省掉整条「嵌入 + 向量库 + 重排」管线,跑的是开源社区正通过 MultiVectorEncoder 标准化的晚期交互(Modern ColBERT)技术,且开源 mxbai 权重打通了托管与自托管两个世界。定价透明、按量计费:$5 免费额度索引 $1.50–$3/百万内容 token语义查询 $4/千次(重排 +$3.50),存储 $0.50/百万 token/月,前沿 Toast 1 搜索模型输入/输出 $0.50 / $1.20 每百万(发布期 40% 折)。如果你要在多模态、真实世界的杂乱文档上做 RAG 且希望托管,这是首选;如果只要原始向量或必须自托管,开源 mxbai 权重 + v6.0 MultiVectorEncoder 是更轻的路线。权威来源见 Mixedbread 定价页文档

如果你要把 Mixedbread(或 Qwen、DeepSeek、OpenAI、Anthropic)接进应用,并希望用一个 OpenAI 兼容 Key 实现按模型路由与定价,FreeModel 是最简单的交接:一个面板、一个账单关系、跨区故障转移,无需胶水代码。