AI21 Labs (Jamba) (AI21 Labs (Jamba))

收录于 https://www.ai21.com

综合排名 #14 ⭐ 可考虑
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Jamba 1.5 Mini: $0.20/M tokens, Jamba 1.5 Large: $2/M tokens 每百万 tokens
输出 (Output) Jamba 1.5 Mini: $0.20/M tokens, Jamba 1.5 Large: $2/M tokens 每百万 tokens
💡 免费额度

无免费额度

🤖 支持模型(共 3 个)

Jamba 1.5 Mini Jamba 1.5 Large Jamba 1.5 Instruct

✨ 优势

  • Jamba 1.5 系列采用 SSM-Transformer 混合架构,398B 总参/94B 激活,长上下文 256K 原生支持
  • OpenAI 兼容 API(/v1/chat/completions),SDK 零改造切换
  • Jamba 1.5 Mini 价格仅 $0.20/M token,性价比优于 GPT-4o-mini 的多数场景
  • 支持工具调用(function calling)与 JSON mode
  • 通过 AWS Bedrock、Microsoft Azure AI Foundry、NVIDIA NIM 三家云市场分发

⚠️ 不足

  • × 模型种类较少(仅 Jamba 系列,无 Llama / Qwen / DeepSeek 转发)
  • × 国内访问需稳定代理,无 ICP / 合规入口
  • × Jamba 1.5 Large 价格($2/M)高于 Llama 3.3 70B($0.39-$0.88/M)
  • × 工具调用可靠性弱于 OpenAI / Anthropic 一线厂商
  • × 第三方基准(如 MMLU、HumanEval)覆盖少于头部闭源模型

🎯 适合场景

需要长上下文(256K)+ 高吞吐的中大型企业;SSM 架构特有的显存效率优势;多云分发场景(Bedrock + Azure AI)

💰 价格与方案

模型输入 ($/百万 token)输出 ($/百万 token)最佳用途
Jamba Mini$0.20$0.40轻量级通用任务、高吞吐量负载
Jamba Large$2.00$8.00长上下文(256K)推理、复杂 RAG、Agent 工作流
Jamba Instruct与对应 base 模型同价与对应 base 模型同价Mini / Large 的指令微调变体,适用于聊天与助手
AI21 Studio(免费试用)$0(试用信用金)$0(试用信用金)studio.ai21.com 上的沙盒环境,原型开发用
Enterprise / On-Demand合同制合同制私有部署、自定义 SLA、专属容量

🔧 API 与开发者体验

  • API 风格: OpenAI 兼容的 /v1/chat/completions 端点,加上 AI21 原生的 /v1/chat 与 /v1/completion 路由——将 base URL 改为 https://api.ai21.com/studio/v1 即可直接替换 OpenAI SDK。
  • Base URL: 托管版(Studio):https://api.ai21.com/studio/v1 直连;AWS Bedrock、Azure AI Foundry、NVIDIA NIM 各在自有 marketplace base URL 下以相同 schema 暴露 Jamba。
  • SDK 可用性: 官方 Python SDK (ai21) 与 TypeScript/Node 客户端;社区提供 Go、Java、Ruby 封装。AI21 文档附 curl 示例与 OpenAI SDK 迁移片段。
  • Function Calling 与 JSON 模式: Jamba Mini 与 Jamba Large 支持工具调用(function calling)与结构化 JSON 输出——多工具复杂链路上的可靠性略逊于 OpenAI / Anthropic,但单工具 schema 覆盖良好。
  • 长上下文(256K): Jamba Mini 与 Jamba Large 均原生支持 256K token 上下文窗口——长文档摘要、大代码库摄取、扩展 Agent 记忆无需切片。
  • 流式与采样控制: 默认提供 SSE 流式响应;所有模型支持完整的 OpenAI 风格采样参数(temperature、top_p、max_tokens、stop、presence/frequency penalty)。
  • 分发渠道: 通过 AI21 Studio(直连)、AWS Bedrock(全托管)、Azure AI Foundry(企业)、NVIDIA NIM(自托管容器)四种采购路径分发同一套模型权重。

🧠 SSM-Transformer 混合架构(Jamba)

Jamba 是目前唯一一款将 Mamba(一种选择性状态空间模型)与 Transformer 注意力机制融合在同一份权重中的主流生产级 LLM。这种混合 block——交替堆叠 Mamba 层、少量注意力层与混合专家(MoE)前馈——让 Jamba 1.5 Large 拥有 398B 总参数,但每 token 仅激活 94B。这一组合正是 256K 原生长上下文可负担的关键:Mamba 的线性时间序列处理大幅降低 KV-cache 与推理成本,而穿插的注意力层保留了纯 SSM 在长 prompt 上丢失的上下文回忆能力。Jamba Mini 与 Large 均以 Apache 2.0 协议开源,权重托管在 Hugging Face,已成为自托管长上下文流水线与数据驻留限制排除纯 API 提供商的本地企业部署的热门基座。

🌐 中国访问与延迟

AI21 Studio(api.ai21.com)托管于美国/欧洲,从中国大陆无法直连;Studio 注册流程在部分套餐上也屏蔽国内支付方式。国内开发者通常通过代理,或经以下三条间接路径使用 Jamba:AWS Bedrock(ap-northeast-1 东京或 ap-east-1 香港可提供 100–250 ms 延迟)、Azure AI Foundry(若租户具备中国区域对等互联)、或在香港/新加坡/东京机房自托管 NVIDIA NIM 容器。对完全面向国内用户的部署,最干净的方案是 Hugging Face 原始权重路径——拉取 Jamba Mini 或 Large 检查点,在国内 GPU(A100 / H800 / 国产替代)上用 vLLM / TensorRT-LLM 部署端点,全程无跨境流量。稳定代理下 Studio 直连往返延迟通常在 250–500 ms;同样硬件下自托管原始权重可为国内终端用户提供 50 ms 以内首 token 延迟。