Mistral OCR 4 API 测评 2026:每 1000 页 $4 的文档智能
Mistral OCR 4 于 2026 年 8 月初发布,是 Mistral 文档智能系列的最新款——它刻意突破了"只读取文字"的传统 OCR。该模型(ID mistral-ocr-4-0)在提取文本的同时返回边界框、块类型分类(标题、表格、公式、签名、列表)以及逐块置信度分数,支持 10 个语系的 170 种语言,并可单容器自托管部署。定价为 API 每 1000 页 $4,批量 API 享 50% 折扣后每 1000 页 $2。
在盲测人工偏好评估中,独立标注者偏向 OCR 4,超过所有被测的领先 OCR 与文档 AI 系统,平均胜率 72%,并在公开 OlmOCRBench 上取得最高总分(85.20)。"分割式输出 + 按页定价 + 自托管"的组合,使 OCR 4 成为企业搜索、检索增强生成(RAG)与智能体摄取管线的有力候选。本 APIRank 测评核实事实、拆解真实单页成本,并与主流文档 AI 方案对比。
📰 Mistral OCR 4 到底是什么(2026-08-03 核实)
Mistral 将 OCR 4 定位为文档智能,而非文本提取。官方公告的核心特性:
- 分割而非纯文本。 每个返回块都带边界框(坐标)、类型分类(标题、副标题、文本、图像、表格、公式、签名、思考)以及逐块置信度分数。下游步骤可以推理某个表格单元格或签名区域,而无需重新解析扁平文本。
- 10 个语系、170 种语言。 适合多语言扫描发票、法律文件、合同与档案数字化。
- 单容器自托管。 整个模型以一个容器交付用于本地部署,面向文档不得离场的合规行业。
- 与 Mistral Search Toolkit 集成(公开预览)。OCR 4 作为摄取组件,把结构化的、可溯源输出的结果喂给 Mistral 发布的开源搜索框架。
Mistral 引用的客户——金融 AI 公司 Rogo——点明了经济性:在一个图表与图形密集的金融 QA 数据集上,团队以约 1/8 的成本和 1/17 的延迟达到了与现有智能体文档解析器相当的准确率。
💰 定价(官方公告核实)
Mistral 对 OCR 4 按页而非按 token 定价——这对文档负载是更清晰的计算方式。以下均来自官方 OCR 4 发布说明。
| 产品 | 价格 | 计费方式 | 备注 |
|---|---|---|---|
| API(mistral-ocr-4-0) | $4 / 1000 页 | 按页 | 标准同步 OCR 端点 |
| 批量 API | $2 / 1000 页 | 按页 | 异步高吞吐任务享 50% 折扣 |
| Document AI | $5 / 1000 页 | 按页 | Mistral Studio 内的托管无代码产品 |
| 自托管 | Mistral 授权 | 按部署 | 单容器本地部署 |
| Large / Small(文本 LLM) | 每百万 $2–$3 in / $6 out | 按 token | 同一 La Plateforme API,供对照 |
规模化之后的账。 每月摄取 1 万页的团队,通过同步 API 只需约 $40,走批量 API 则是 $20——而同样的量如果走按 token 计费的前沿视觉模型,可能高达数千美元,因为每一页都会消耗几十万图像 token。每月 10 万页时,批量价低至 $200。这就是按页模型的核心理由:可预测、线性,便宜到可以无预算争议地扫描整个历史档案库。
🔧 结构化输出:真正的差异化
让 OCR 4 超越"带文字的扫描仪"的,是它每块返回的结构化元数据。传统 OCR API 给你一串单词和粗略坐标,而 OCR 4 给你:
- 边界框,覆盖每个检测到的区域,保留版式以支持下游重排或脱敏流程。
- 块类型分类——标题、副标题、文本、图像、表格、公式、签名、"思考"块——让表格单元格路由到表格解析器、签名区域路由到 KYC 检查,无需启发式规则。
- 逐块置信度分数,驱动可溯源引用、脱敏与人工复核。
对检索管线团队而言,这区别在于"找到了表格附近的文本"还是"知道这是置信度 0.98 的签名块"。这与现代视觉 OpenAI 兼容 API 中涌现的结构化输出是同一思路。
🧠 基准:OCR 4 胜在哪里
Mistral 引用了三类基准,均来自官方发布说明:
- 人工偏好评估: 独立标注者偏向 OCR 4,超过所有被测的领先 OCR 与文档 AI 系统,平均 72% 胜率。
- OlmOCRBench: 被测系统中最高总分 85.20。
- OmniDocBench: 93.07;内部 Crawl Multilingual 评估 .98,领先于 AI 原生与企业级方案。
Mistral 自己也提醒:OlmOCRBench 与 OmniDocBench 等自动化基准存在已知评分局限(标注与格式噪声),因此人工偏好结果才是头条。请把原始数字当作方向性参考而非绝对结论。
💼 最适合 OCR 4 的使用场景
按页定价与结构化输出指向特定负载,这些场景中 OCR 4 优于通用 OCR 与 chat-vision:
- 企业 RAG 与知识库。 摄取 PDF、扫描合同与幻灯片,保留版式与置信度元数据,把干净分块喂给向量索引用于检索增强生成。类型化块让你按真实语义分块——一页变为一组带坐标与分数的标题、段落、表格与公式块。
- KYC、合规与合同审查。 签名块与置信度分数是自动签名检测、文档脱敏与人工复核的原料,可大幅削减开户与电子证据发现的人工分诊负担。
- 保险理赔与医疗。 结构化提取表单、病历与保单,自托管容器让受保护数据留在机构内部。
- 图书馆与档案数字化。 170 种语言覆盖与单容器部署适合需要批量、本地处理的档案馆、报纸与多语言文化遗产馆藏。
- 财务报表。 图表与表格密集的申报文件正是 Mistral 客户报告 8 倍成本差与 17 倍延迟差的场景。
如果负载主要是"读一张图并告诉我内容",请继续使用 chat-vision 模型——OCR 4 是文档管线工具,不是通用图像问答端点。
🆚 Mistral OCR 4 与主流文档 AI 对比
与团队现用的文档抽取方案相比,OCR 4 处于什么位置?
| 维度 | Mistral OCR 4 | 云文档 AI(Azure/Google/AWS) | 前沿对话视觉(GPT-4o 级) |
|---|---|---|---|
| 输出 | 文本 + 边界框 + 块类型 + 置信度 | 文本 + 部分版式,各家 schema 不同 | 自由文本,临时标记 |
| 定价模型 | 按页($4/千,批量 $2) | 每千页 / 每次调用,分档 | 按 token(图像 token 数巨大) |
| 自托管 | 单容器——内建 | 基本仅托管 | 不可(专有 API) |
| 语言 | 10 语系 170 种 | 因厂商而异,主流文字较强 | 广但 token 成本高 |
| 欧盟驻留 | 欧盟数据中心(原生) | 依区域而定 | 依区域而定 |
OCR 4 最明显的优势是:(1) 可预测的按页定价且对量有真实折扣;(2) 一流的自托管能力。如果你已在 OpenAI 兼容技术栈上做对话,请注意 OCR 4 是专用 OCR 模型而非 chat-completions 模型——文档任务请预留单独的端点调用。
🛠️ 快速上手(Python SDK)
调用 OCR 4 只需一次请求,走标准 Mistral Python SDK。最小示例:
from mistralai import Mistral
client = Mistral(api_key="你的_MISTRAL_KEY")
# 指向一个 PDF 或图像,页面返回为文本 + 元数据
resp = client.ocr.process(
model="mistral-ocr-4-0",
document={"type": "document_url", "document_url": "https://example.com/contract.pdf"},
)
for page in resp.pages:
print(page.index, page.markdown[:120]) # 抽取文本
for block in page.blocks:
print(block['type'], block.get('confidence')) # 块类型 + 分数
高吞吐任务优先走批量 API:一次提交文档清单、轮询结果,并享受每 1000 页 $2 而不是 $4 的价格。批量路径也适合对延迟不敏感的回填——年报扫描、档案数字化、发票重处理——这类任务要的是吞吐与成本而非单次延迟。关于 Mistral 更广的模型线,可看我们此前的 Mistral AI API 测评。
🔐 安全与数据隐私
数据驻留是 OCR 4 与按 token 计费的前沿视觉 API 拉开差距的地方。因为 Mistral 从欧盟数据中心运行,经托管 API 处理的文档默认处于欧盟数据保护规则之下;而且因为模型以单容器交付,合规行业的团队可以整条管线都跑在本地或自有 VPC 内——文档永不离开网络。逐块置信度分数还支持策略化脱敏:低置信度的 PII 或签名区域可在人工复核前被自动标记,符合金融、法律与医疗审计要求。如果你已在用 托管的文档 AI,投入前请对比双方的驻留承诺。
⚠️ 已知局限
- 无中国大陆端点。 Mistral 从欧盟数据中心提供服务,无大陆直连与官方访问计划;跨境生产需要代理或聚合器,或国内 OCR 备用方案。
- 按页定价而非按模型组合。 预算清晰,但没有逐 token 粒度,极短的单行扫描也按整页计费。
- 基准保留。 OlmOCRBench 与 OmniDocBench 存在已知打分噪声;投入前请在你的文档样本上自行验证。
- 专用 OCR 端点。 它不是通用对话视觉模型——重点是结构化文档解析,而非开放式图像问答。
🎯 结论
Mistral OCR 4 是结构化、高吞吐文档智能的强有力选择——尤其是当你需要欧盟驻留或自托管时。每 1000 页 $4(批量 $2)的定价有竞争力且可预测,结构化输出(边界框、块类型、置信度)对 RAG 与 KYC 管线确实有用,单容器部署选项在该类别中少见。但一次性开放式图像问答不太适合它(请用对话视觉模型),且中国大陆直连需要代理。如果你的负载是合规要求下的多语言规模化扫描,OCR 4 值得认真试点。
FAQ
什么是 Mistral OCR 4?
Mistral OCR 4 是 Mistral 于 2026 年 8 月在 La Plateforme API 上发布的文档智能 OCR 模型(ID mistral-ocr-4-0)。与普通文本 OCR 不同,它返回边界框、块类型分类与逐元素置信度分数,并支持单容器自托管部署。
Mistral OCR 4 如何计费?
API 每 1000 页 $4,批量 API 享 50% 折扣后每 1000 页 $2(异步高吞吐任务)。托管 Document AI 产品每 1000 页 $5。自托管使用 Mistral 授权。
Mistral OCR 4 支持多少种语言?
支持 10 个语系的 170 种语言,适合多语言扫描发票、法律文件、合同与档案数字化。
Mistral OCR 4 在基准测试中表现如何?
盲测人工偏好评估偏向 OCR 4,超过所有被测领先方案,平均胜率 72%。它在 OlmOCRBench 上得分 85.20,在 OmniDocBench 上得分 93.07,在内部 Crawl Multilingual 上得分 .98。
Mistral OCR 4 可以自托管吗?
可以。OCR 4 在单个容器中运行以实现完全自托管,适合需要文档留在本地的合规行业(法律、医疗、政府、金融)或数据驻留要求。
中国大陆能直接使用 Mistral OCR 4 吗?
Mistral 从欧盟数据中心提供服务,无大陆端点或官方访问计划。请使用稳定的海外代理或聚合器;高吞吐扫描可选用国内 OCR 端点作为延迟安全的备用方案。
相关阅读
- Mistral AI API 测评——模型、定价与中国访问
- OpenAI 兼容 API 生态
- Anyscale API 测评——Ray 与 Endpoints
- DeepSeek API 测评
- Qwen Image 3.0 API 定价
来源:Mistral OCR 4 官方公告、Mistral 文档。定价与基准数据已于 2026-08-09 核实。