Mixedbread AI (Mixedbread AI)

收录于 https://www.mixedbread.com

综合排名 #22 ⭐ 可考虑
❌ 无中国大陆直连端点。Mixedbread 是美国/欧洲平台(法人实体 mixedbread ai inc.,柏林/旧金山),大陆直连需代理或海外中转,跨太平洋首字节延迟通常 150-250ms。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) 按量计费,三块:索引(Fast $1.50/百万内容 token;High Quality 含 OCR/转写/摘要/多模态增强 $3/百万)、搜索(Grep $0.10/千次、Semantic $4/千次、Toast 1 $1/千次,重排 +$3.50 或 +$1.50/千次)、存储 $0.50/百万内容 token/月。Toast 1 按 LLM token:输入 $0.50/百万(发布价 $0.30)。 每百万 tokens
输出 (Output) Toast 1 输出 $1.20/百万 LLM token(发布价 $0.72,40% 折扣);缓存输入 $0.06/百万(发布价 $0.036),缓存写入免费。Semantic 检索重排加价 $3.50/千次。 每百万 tokens
缓存读取 缓存输入 token 计费远低于全新输入——Toast 1 缓存 $0.06 vs 全新 $0.50(约 -88%),缓存写入免费。 享折扣
💡 免费额度

Starter 免费送 $5 一次性额度,无需信用卡;3 个工作区用户、10 个 Store、每分钟 100 次请求,适合评估真实语料。无永久免费档。

🤖 支持模型(共 5 个)

Toast 1 — specialized search model (2026-08-13): matches/outperforms Claude Opus 5 and GPT-5.6 Sol on knowledge work, up to 10x cheaper and 12x faster; input $0.50 / cached $0.06 / output $1.20 per 1M LLM tokens (launch $0.30 / $0.036 / $0.72) mxbai-embed-large-v1 — 1,024-dimension open embedding model (Apache-2.0), 50M+ downloads across the mxbai family mxbai-rerank-v3.1-listwise — default reranker (2026-07-27), GPT-5.6 Sol-level ranking quality, ~25-54% faster than v3 mxbai-rerank-base-v2 / mxbai-rerank-large-v2 / mxbai-rerank-xsmall-v1 — open rerank weights Modern ColBERT (managed) — late-interaction multi-vector retrieval over 2.5B+ documents at 10k+ queries/sec, #1 on BrowseComp-Plus

✨ 优势

  • 托管「检索即服务」:上传 PDF/图片/代码/视频即可语义检索,无需自建嵌入与向量库,覆盖 100+ 语言
  • 底层跑 Modern ColBERT(后期交互多向量检索),支撑 25 亿+ 文档、每秒 1 万+ 查询,BrowseComp-Plus 排名第一
  • Toast 1 搜索模型(2026-08-13):知识任务匹配/超过 Claude Opus 5 与 GPT-5.6 Sol,便宜最多 10 倍、快 12 倍
  • 开源 mxbai 家族下载超 5000 万:mxbai-embed-large-v1(1024 维)+ mxbai-rerank-v3.1-listwise(GPT-5.6 Sol 级重排、延迟低 25-54%)
  • 端到端含 OCR、转写、多模态增强的 High Quality 索引($3/百万内容 token)
  • Bring Your Own Bucket:源数据留在你拥有的对象存储,Mixedbread 基础设施不保留内容
  • Starter 免费 $5 额度、无需信用卡;Agentic 检索可流式输出追踪事件

⚠️ 不足

  • × 检索只能托管——完整 Search API(Modern ColBERT/Wholembed/多模态)是封闭平台,无法自托管整套检索栈
  • × 无中国大陆直连端点,大陆生产需代理/中转,跨太平洋延迟 150-250ms
  • × 搜索按查询次数计费(Semantic $4/千次),高频率搜索(每月上千万次)成本可能超过平价的嵌入+向量库方案
  • × 无裸嵌入向量 API——只要 1,024 维向量并自建索引时,托管产品更贵;应改用开源权重或专用嵌入 API
  • × Toast 1 发布价 40% 折扣为临时优惠,常规价为 $0.50/$1.20 每百万(按常规价做预算)

🎯 适合场景

想托管做生产级 RAG 的团队:不愿自建「嵌入 + 向量库 + 重排」管线,要在多模态、真实世界的杂乱文档(PDF/图片/视频/表格)上快速上线语义检索,且需要 100+ 语言覆盖与 25 亿+ 文档级的规模化检索能力。

💰 价格与方案

模块模式 / 模型价格备注
索引Fast$1.50 / 百万内容 token内容感知分词
索引High Quality$3.00 / 百万内容 tokenOCR、转写、摘要、多模态增强
搜索Grep$0.10 / 千次查询精确 / 正则匹配
搜索Semantic$4.00 / 千次查询细粒度语义检索;重排 +$3.50/千次
搜索Toast 1$1.00 / 千次查询前沿搜索模型;重排 +$1.50/千次
存储按 token 月费$0.50 / 百万内容 token / 月让已索引数据随时可检索
LLM token(Toast 1)输入$0.50 / 百万(发布价 $0.30)面向知识任务的专用搜索模型
LLM token(Toast 1)缓存输入$0.06 / 百万(发布价 $0.036)缓存写入免费
LLM token(Toast 1)输出$1.20 / 百万(发布价 $0.72)发布期 40% 折扣

🔧 API 与开发者体验

  • API 风格: REST + 面向 Toast 1 搜索模型的 OpenAI 兼容 Chat Completions 接口。/question 文档端点以结构化答案响应,Agentic 检索可流式输出 server-sent 追踪事件。
  • 模型类型: 一个 API 端到端覆盖检索:Modern ColBERT 语义搜索、Grep(精确/正则)、重排、分块、经 High Quality 索引的 OCR/转写,以及面向知识任务的 Toast 1 搜索模型。
  • 多模态: 上传 PDF、图片、表格、音频、视频、代码与文档;Mixedbread 内部处理 OCR、转写与多模态增强,覆盖 100+ 语言。
  • 存储与隐私: Bring Your Own Bucket 让源数据留在你拥有的对象存储;每个索引产物都持久化到你的桶里,Mixedbread 基础设施不保留任何内容。
  • Agentic 检索: Agentic 模式(2026-08-19 起可流式)让 agent 实时观察检索、输出推理事件,并在多步检索中收敛到答案。
  • 集成: SDK 与 API 支持建 Store、上传文件、检索与重排;提供 Dashboard、Discord 与 GitHub 社区;开源 mxbai 权重在 Hugging Face 上可自托管嵌入/重排。
  • 套餐与限额: Starter:$5 额度、3 用户、10 Store、100 次请求/分钟。Scale:$20/月 + 按量,限额更高、优先支持。企业版商务报价,含定制模型与自托管选项。

⚡ Modern ColBERT 与多向量时代

Mixedbread 是后期交互、多向量检索的生产化面孔。其托管 Search API 用 Modern ColBERT 支撑 25 亿+ 文档、每秒 1 万+ 查询,并占据 BrowseComp-Plus 检索基准第一名,让团队无需自建整套即可获得经生产验证的 LTR 质量。这一点现在很重要,因为开源生态正在把同样的理念标准化:Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,可直接加载任何 PyLate、Stanford-NLP ColBERT 或 colpali-engine checkpoint,走同一个熟悉 API。自托管 dense 方案每篇文档只建一个向量、丢失 token 级细粒度语义;多向量后期交互则每篇存多个向量,用 MaxSim 打分匹配,在长文档、主题密集的检索上可测地提升质量。Mixedbread 再配上 Wholembed v3 查询引擎(查询编码 p50 延迟降 39%)与开源 mxbai embed/rerank 权重,开发者可按对控制权与成本的需求,选择托管 LTR 或自托管同一模型家族。

🌐 区域可用性与延迟

Mixedbread 是美国/欧洲平台(法人实体 mixedbread ai inc.,工程团队位于柏林与旧金山),通过 Cloudflare 边缘交付服务全球 API。对北美与欧洲团队,首字节延迟低,托管检索栈完全托管,没有区域自托管变体。从中国大陆无法直连,生产流量需要代理或中转,典型跨太平洋首字节延迟 150-250ms;由于「一次索引多次读取」的模型,数据接入后经中转仍能良好工作。存储模型因 Bring Your Own Bucket 支持而与区域无关,延迟主要取决于你的对象存储与中转所在位置,而非 Mixedbread 基建。对全球分布式 RAG,务实做法是在团队或桶所在区域附近接入数据,让托管检索层从单一全局控制面服务查询。