AI21 Labs (Jamba) (AI21 Labs (Jamba))
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Jamba 1.5 Mini: $0.20/M tokens, Jamba 1.5 Large: $2/M tokens | 每百万 tokens |
| 输出 (Output) | Jamba 1.5 Mini: $0.20/M tokens, Jamba 1.5 Large: $2/M tokens | 每百万 tokens |
无免费额度
🤖 支持模型(共 3 个)
✨ 优势
- ✓ Jamba 1.5 系列采用 SSM-Transformer 混合架构,398B 总参/94B 激活,长上下文 256K 原生支持
- ✓ OpenAI 兼容 API(/v1/chat/completions),SDK 零改造切换
- ✓ Jamba 1.5 Mini 价格仅 $0.20/M token,性价比优于 GPT-4o-mini 的多数场景
- ✓ 支持工具调用(function calling)与 JSON mode
- ✓ 通过 AWS Bedrock、Microsoft Azure AI Foundry、NVIDIA NIM 三家云市场分发
⚠️ 不足
- × 模型种类较少(仅 Jamba 系列,无 Llama / Qwen / DeepSeek 转发)
- × 国内访问需稳定代理,无 ICP / 合规入口
- × Jamba 1.5 Large 价格($2/M)高于 Llama 3.3 70B($0.39-$0.88/M)
- × 工具调用可靠性弱于 OpenAI / Anthropic 一线厂商
- × 第三方基准(如 MMLU、HumanEval)覆盖少于头部闭源模型
🎯 适合场景
需要长上下文(256K)+ 高吞吐的中大型企业;SSM 架构特有的显存效率优势;多云分发场景(Bedrock + Azure AI)
💰 价格与方案
| 模型 | 输入 ($/百万 token) | 输出 ($/百万 token) | 最佳用途 |
|---|---|---|---|
| Jamba Mini | $0.20 | $0.40 | 轻量级通用任务、高吞吐量负载 |
| Jamba Large | $2.00 | $8.00 | 长上下文(256K)推理、复杂 RAG、Agent 工作流 |
| Jamba Instruct | 与对应 base 模型同价 | 与对应 base 模型同价 | Mini / Large 的指令微调变体,适用于聊天与助手 |
| AI21 Studio(免费试用) | $0(试用信用金) | $0(试用信用金) | studio.ai21.com 上的沙盒环境,原型开发用 |
| Enterprise / On-Demand | 合同制 | 合同制 | 私有部署、自定义 SLA、专属容量 |
🔧 API 与开发者体验
- •API 风格: OpenAI 兼容的 /v1/chat/completions 端点,加上 AI21 原生的 /v1/chat 与 /v1/completion 路由——将 base URL 改为 https://api.ai21.com/studio/v1 即可直接替换 OpenAI SDK。
- •Base URL: 托管版(Studio):https://api.ai21.com/studio/v1 直连;AWS Bedrock、Azure AI Foundry、NVIDIA NIM 各在自有 marketplace base URL 下以相同 schema 暴露 Jamba。
- •SDK 可用性: 官方 Python SDK (ai21) 与 TypeScript/Node 客户端;社区提供 Go、Java、Ruby 封装。AI21 文档附 curl 示例与 OpenAI SDK 迁移片段。
- •Function Calling 与 JSON 模式: Jamba Mini 与 Jamba Large 支持工具调用(function calling)与结构化 JSON 输出——多工具复杂链路上的可靠性略逊于 OpenAI / Anthropic,但单工具 schema 覆盖良好。
- •长上下文(256K): Jamba Mini 与 Jamba Large 均原生支持 256K token 上下文窗口——长文档摘要、大代码库摄取、扩展 Agent 记忆无需切片。
- •流式与采样控制: 默认提供 SSE 流式响应;所有模型支持完整的 OpenAI 风格采样参数(temperature、top_p、max_tokens、stop、presence/frequency penalty)。
- •分发渠道: 通过 AI21 Studio(直连)、AWS Bedrock(全托管)、Azure AI Foundry(企业)、NVIDIA NIM(自托管容器)四种采购路径分发同一套模型权重。
🧠 SSM-Transformer 混合架构(Jamba)
Jamba 是目前唯一一款将 Mamba(一种选择性状态空间模型)与 Transformer 注意力机制融合在同一份权重中的主流生产级 LLM。这种混合 block——交替堆叠 Mamba 层、少量注意力层与混合专家(MoE)前馈——让 Jamba 1.5 Large 拥有 398B 总参数,但每 token 仅激活 94B。这一组合正是 256K 原生长上下文可负担的关键:Mamba 的线性时间序列处理大幅降低 KV-cache 与推理成本,而穿插的注意力层保留了纯 SSM 在长 prompt 上丢失的上下文回忆能力。Jamba Mini 与 Large 均以 Apache 2.0 协议开源,权重托管在 Hugging Face,已成为自托管长上下文流水线与数据驻留限制排除纯 API 提供商的本地企业部署的热门基座。
🌐 中国访问与延迟
AI21 Studio(api.ai21.com)托管于美国/欧洲,从中国大陆无法直连;Studio 注册流程在部分套餐上也屏蔽国内支付方式。国内开发者通常通过代理,或经以下三条间接路径使用 Jamba:AWS Bedrock(ap-northeast-1 东京或 ap-east-1 香港可提供 100–250 ms 延迟)、Azure AI Foundry(若租户具备中国区域对等互联)、或在香港/新加坡/东京机房自托管 NVIDIA NIM 容器。对完全面向国内用户的部署,最干净的方案是 Hugging Face 原始权重路径——拉取 Jamba Mini 或 Large 检查点,在国内 GPU(A100 / H800 / 国产替代)上用 vLLM / TensorRT-LLM 部署端点,全程无跨境流量。稳定代理下 Studio 直连往返延迟通常在 250–500 ms;同样硬件下自托管原始权重可为国内终端用户提供 50 ms 以内首 token 延迟。