Jina AI (Jina AI)
收录于 https://jina.ai
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Embeddings v3: $0.02/M tokens (10K free); Reranker v3: $0.018/M tokens (10K free); Reader: $0.02/M tokens (free up to 1M tokens); CLIP-v1: $0.02/M tokens | 每百万 tokens |
| 输出 (Output) | Flat per-million-token billing, no tier-based markup; batch discount of 50% available on all endpoints | 每百万 tokens |
10,000 free tokens/month on Embeddings + Reranker; Reader API free up to 1M tokens/month; no credit card required to start
🤖 支持模型(共 9 个)
✨ 优势
- ✓ jina-embeddings-v3 是 2024 年开源的 570M 参数 SOTA 嵌入模型,8K context + Matryoshka 维度压缩(32/64/128/256/512/768/1024 一键切换)
- ✓ Reader API 一行代码把任意 URL 变成干净 Markdown,RAG 数据采集的事实标准
- ✓ jina-reranker-v3 多语言重排序器,支持 100+ 语言,对中文/英文混合检索表现优于 Cohere Rerank-3
- ✓ CLIP-v1 多模态嵌入,文本-图像跨模态检索原生支持,89 语种
- ✓ 专门为 RAG 设计的端点:Embeddings + Reranker + Reader 三件套可独立调用也可 pipeline 串联
- ✓ 10K tokens/月免费额度永久有效,无需信用卡
- ✓ 开源多个 base 模型(Apache 2.0):jina-embeddings-v2-base-* 4 个变体可商用
- ✓ 提供 OpenAI 兼容 API 端点,迁移成本几乎为零
⚠️ 不足
- × 仅 embedding/reranker/reader,不提供 LLM/chat 能力
- × 国内访问需代理(AWS US-East + EU-Frankfurt,无大陆边缘节点)
- × Embeddings v3 单次请求最大 8192 tokens,超长文档需切片
- × Reader API 对 SPA/JavaScript 渲染页支持有限,复杂 web app 仍需 headless browser fallback
- × 无中文文档,模型 prompt 英文最佳
- × 无联盟推广计划(API 链接仅 UTM 追踪)
🎯 适合场景
RAG 流水线的嵌入 + 重排序 + 数据采集;多语言(中英德法西日韩)检索;长文档切片与维度压缩;与 LlamaIndex/LangChain/AutoGen 原生集成
💰 价格与方案
| 方案 | Token 数量 | 价格 | 折算单价 |
|---|---|---|---|
| 实验试用 | 1000 万免费 | $0 | 免费(CC-BY-NC,仅限非商用) |
| 原型开发 | 10 亿 | $50 | $0.05 / 百万 token |
| 生产部署 | 110 亿 | $500 | $0.045 / 百万 token |
🔧 API 与开发者体验
- •端点: 提供面向检索的独立 REST 端点——/v1/embeddings、/v1/rerank、/v1/reader、/v1/search——专为搜索与检索流水线设计而非聊天。
- •OpenAI 兼容: 嵌入端点沿用 OpenAI /v1/embeddings 结构,从 text-embedding-3/ada 迁移几乎是换 base-URL 和 key 即可完成的 drop-in 替换。
- •Reader 与 Search: 在任意 URL 前加 r.jina.ai 即可返回干净、LLM 就绪的 Markdown;s.jina.ai 返回网页搜索 SERP——两者均可单次 GET 请求调用。
- •MCP Server: mcp.jina.ai 将 Reader + Search 暴露为 MCP 工具,让 Claude/Cursor/GPT 智能体能在单次会话内实时抓取网页内容。
- •批量折扣: 所有端点都提供 5 折批量折扣——异步提交批量 job,以一半的 token 单价完成批量嵌入、重排序或文档入库。
- •SDK 与工具: 提供 Python、Node SDK,并与 LlamaIndex、LangChain、Haystack 原生集成;内建 Qdrant、Weaviate、Chroma 等向量数据库适配器。
- •多语言与动态维度: Matryoshka 输出支持从单一模型请求 32→2048 维度;支持 100+ 语言,无需按语言单独选模型。
🔍 RAG 原生搜索基础模型
Jina AI 是一家搜索基础模型公司:它提供的是检索系统所需的三类原语——嵌入(embeddings)、重排序(reranker)与 URL Reader——而非通用聊天模型。当前产品线为 v5 系列:jina-embeddings-v5-omni-small(1.7B,32K 上下文,支持文本/图像/音频/视频)让所有模态共享同一个嵌入空间('一个嵌入服务所有'),因此文本查询可直接检索视频、图像或音频文档而无需分别建模;v5-text-nano(239M)面向边缘部署,8K 上下文。jina-reranker-v3.5(2026 年 7 月)在 131K token 输入上提供 listwise 重排序,支持 100+ 语言。由于所有端点共用同一个 token 池,完整的 RAG 流水线——嵌入、检索、重排序、读取——以统一方式计费。开源(Apache/AI 模型许可)版本允许团队自托管用于生产。
🌐 中国访问与延迟
Jina AI 的 API 部署在 AWS 美东与欧盟法兰克福,无中国大陆边缘节点,因此从大陆直连通常需要稳定代理或专线/VPC 中转。从中国的延迟一般在 300ms–1.5 秒之间,取决于代理质量——对批量入库尚可接受,但在搜索回路内的实时重排序中会明显感知。面向中国用户提供服务的团队,可行方案是 (a) 通过自托管聚合器或边缘路由转发,或 (b) 在国内 GPU 上自托管 Jina 开源的嵌入/重排序权重。API 本身按 token 即用即付,无区域加价——但中国 IP 的 curl 直连在无可用代理时会失败。