Cerebras (Cerebras)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | $0.10/M to $0.60/M tokens(所有模型统一 $0.60/M input) | 每百万 tokens |
| 输出 (Output) | $0.10/M to $0.60/M tokens(统一 $0.60/M output) | 每百万 tokens |
免费速率限制(限制 RPM,适合测试)
🤖 支持模型(共 7 个)
✨ 优势
- ✓ WSE-3 晶圆级芯片,2000+ tok/s 推理速度
- ✓ Llama 3.3 70B 达 2,000+ tok/s,行业最快
- ✓ 零冷启动(Zero cold start)
- ✓ OpenAI 兼容 API
- ✓ 定价合理($0.60/M tokens 统一费率)
- ✓ GPU 替代方案,推理芯片设计独特
⚠️ 不足
- × 国内需代理访问
- × 模型品种有限(仅 6 个)
- × 不支持 Function Calling
- × 速度虽快但模型性能依赖 Llama/Qwen 基座
- × 非通用推理芯片架构,第三方支持有限
- × 多模态模型缺失
🎯 适合场景
对推理速度要求极致的应用;高吞吐实时场景;Llama 系列模型高性能推理
💰 价格与方案
| 模型 / 方案 | 输入 ($/M token) | 输出 ($/M token) | 速度 | 备注 |
|---|---|---|---|---|
| Free Trial(免费试用) | $0(注册即送 $5 信用金) | $0(注册即送 $5 信用金) | 全速 | 所有 Cerebras 接入的模型;Discord 社区支持;信用金用尽即止 |
| Developer(按量自助) | 从 $10 自助充值起 | — | 10 倍于免费试用限额;更高优先级 | 通过 cloud.cerebras.ai 自助;含 Free 全部权益,叠加更高优先级处理 |
| Enterprise(销售模式) | 合同制 | 合同制 | 保留容量;可定制权重 | 最高速率上限、专属队列优先级、支持模型微调、SLA 保障 |
| GPT-OSS 120B (openai/gpt-oss-120b) | $0.35 | $0.75 | ~3,000 tok/s | 公共 endpoint 旗舰;免费 65k / 付费 131k 上下文;最大输出免费 32k / 付费 40k |
| Gemma 4 31B (gemma-4-31b) | $0.99 | $1.49 | ~1,850 tok/s | 多模态(文本 + 图像输入);免费 65k / 付费 131k 上下文;支持并行工具调用 |
| Llama 3.3 70B(旧版 / 专用 endpoint) | 联系销售 | 联系销售 | 专用容量 | 已于 2026 年从公共 endpoint 移除;仅通过 Dedicated Endpoints 走保留容量 |
🔧 API 与开发者体验
- •OpenAI 兼容 Chat Completions: /v1/chat/completions 与 OpenAI API 完全兼容——将 base URL 指向 https://api.cerebras.ai/v1 即可替换任何 OpenAI SDK;标准采样参数(temperature、top_p、frequency_penalty、presence_penalty、seed、logit_bias)均受支持。
- •行业最快的推理速度: GPT-OSS 120B 实测约 3,000 tok/s、Gemma 4 31B 约 1,850 tok/s;整个模型驻留在单一晶圆级芯片上而非分散于 GPU,首 token 延迟控制在 100 ms 以内。
- •原生 Python 与 Node.js SDK: cerebras.cloud.sdk(Python)与 Node.js 客户端封装 REST API;免费档提供 5 RPM / 30k 输入 token/min,日上限 1M;Developer 档升至 1,000 RPM / 1M token/min。
- •标准大模型能力: 推理(可配置 reasoning_effort:low/medium/high)、流式响应、结构化输出(JSON schema)、工具调用、Prompt Caching、采样控制——两个模型(GPT-OSS 120B、Gemma 4 31B)均支持。
- •多模态图像输入: Gemma 4 31B 支持在 Chat Completions 中传入图像(文本 + 图像 → 文本),适用于视觉代理工作流、文档问答、截图转代码;Developer 档每请求最多 10 张图(免费档 2 张)。
- •专用 endpoint 保留容量: 除公共共享 endpoint 外,Cerebras 提供 Dedicated Endpoints 接入旧版 Llama/Qwen 模型及自定义权重——享受保障容量、专属队列优先级、微调支持以及 7x24 SLA 支持。
🧠 晶圆级推理与 WSE-3
Cerebras 的标志性能力是第三代晶圆级引擎 WSE-3——一块相当于餐盘尺寸的单片硅晶圆,可承载整个大模型而非分散到多块 GPU。WSE-3 集成 44 GB 片上 SRAM 与约 90 万个 AI 优化核心,通过带宽达数十 PB/s 的片上网络互连,因此能将全球最大模型完整驻留在片内,彻底消除跨 GPU 通信开销。实测推理速度在 GPT-OSS 120B 上达约 3,000 tok/s、Gemma 4 31B 上约 1,850 tok/s,约为 OpenAI / Anthropic 流式端点的 20 倍。由于模型永不离开晶圆,即使在长 prompt 下首 token 延迟也保持在 100 ms 以内,这正是 Cerebras 独特适用于交互式编程助手、语音代理、实时文档问答的关键所在。Dedicated Endpoints 计划进一步将同一晶圆开放给自定义权重,企业可在同一物理基板上微调或托管私有模型部署。
🌐 中国访问与延迟
api.cerebras.ai 全部部署于 Cerebras 美国数据中心,国内 ISP 直连不可达,必须使用稳定代理才能访问。cloud.cerebras.ai 的注册页在国内加载也较慢,新开发者普遍反馈页面解析前需 5-30 秒,控制台和 Playground 偶发超时。通过代理拿到 API key 后,从国内服务器发出请求的往返延迟通常在 200-500 ms,远高于 Cerebras 美国节点宣传的 100 ms 以内首 token 延迟。面向国内的生产部署通常有以下几条路径:经香港/新加坡/东京代理并通过 Dedicated Endpoints 预约容量;或改用 Cerebras 的合作渠道(OpenRouter、Hugging Face、AWS Marketplace、Vercel),这些合作伙伴提供带有区域路由的镜像端点。国内初创公司若要用 Cerebras 承担语音、编程或实时代理工作负载,应将代理延迟计入 p99 SLO 预算,并设计好代理劣化时回切国产 provider 的兜底路径。