Groq (Groq)

收录于 https://console.groq.com

综合排名 #13 ⭐ 可考虑
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Llama 3.3 70B: $0.59/M, DeepSeek-R1: $0.89/M, Mixtral 8x7B: $0.15/M 每百万 tokens
输出 (Output) Llama 3.3 70B: $0.79/M, DeepSeek-R1: $0.89/M, Mixtral 8x7B: $0.15/M 每百万 tokens
💡 免费额度

免费速率限制(足够个人开发和小型测试使用)

🤖 支持模型(共 12 个)

Llama 3.3 70B Llama 3.1 405B Llama 3.2 90B DeepSeek-R1 Mixtral 8x7B Gemma 2 9B

✨ 优势

  • LPU 推理引擎:Llama 3.3 70B 达 1,250 tok/s
  • 行业最快推理速度
  • Llama 3.3 70B 仅 $0.59/M input 性价比超高
  • 免费额度慷慨
  • OpenAI 兼容 API,无缝迁移
  • GroqCloud 平台持续扩张模型库

⚠️ 不足

  • × 国内需代理访问
  • × 模型数量有限(以开源模型为主)
  • × 不支持 Function Calling
  • × LPU 对非 Meta 模型的优化有限
  • × 无海外节点,影响全球延迟表现

🎯 适合场景

对推理速度有极致要求的应用;高吞吐实时场景;开源模型的高性能部署

💰 价格与方案

模型输入 ($/百万 token)输出 ($/百万 token)速度 (t/s)备注
GPT-OSS 120B (openai/gpt-oss-120b)$0.15$0.60500开源权重推理旗舰;131K 上下文,65K 最大输出
GPT-OSS 20B (openai/gpt-oss-20b)$0.075$0.301000GroqCloud 最快档;131K 上下文,支持 prompt 缓存
GPT-OSS-Safeguard 20B (openai/gpt-oss-safeguard-20b)$0.075$0.301000面向分类任务的安全微调变体
Qwen 3.6 27B (qwen/qwen3.6-27b)$0.60$3.00500阿里推理模型;131K 上下文,16K 最大输出
Whisper Large V3 (whisper-large-v3)$0.111 / 音频小时语音转文字;免费档 200K ASH / 300 RPM,开发者档 7.2K ASH
Whisper Large V3 Turbo (whisper-large-v3-turbo)$0.04 / 音频小时更快 STT 变体;400K ASH / 400 RPM 开发者限额
Llama 3.1 8B Instant (Enterprise)联系销售联系销售560自助档已下线;仅企业合同可访问
Llama 3.3 70B Versatile (Enterprise)联系销售联系销售280自助档已下线;仅企业合同可访问
Compound / Compound-Mini (Agent)450内置工具编排(web 搜索、代码、浏览器);按量计费

🔧 API 与开发者体验

  • OpenAI 兼容端点: Base URL https://api.groq.com/openai/v1 镜像 OpenAI 的 /chat/completions 与 /responses schema —— 现有 OpenAI SDK(Python/JS)只需替换 base-URL 和 Key 即可迁移,零代码重构。
  • 原生 Groq SDK: 官方 Python 与 JavaScript/TypeScript SDK(groq-sdk)提供 chat、speech、vision、batch、tool-use 端点的类型化访问,开箱即用支持流式与结构化输出。
  • Prompt 缓存: GPT-OSS 20B/120B 和 Safeguard 20B 自动前缀缓存,缓存输入 token 享 5 折且无需修改代码;仅 volatile 存储(2 小时 TTL),缓存 token 不计入速率限制。
  • 服务等级: 通过 service_tier 参数切换四档:performance(仅企业,最低延迟)、on_demand(默认)、flex(更高吞吐,尽力交付)、auto(Groq 自行选择最佳档位)。
  • 内置工具: 服务端 web 搜索(Visit Website)、代码执行、Wolfram Alpha、浏览器搜索(GPT-OSS 模型) —— 无需自建 agent 框架;按标准费率计费。
  • Compound Agent 模型: groq/compound 与 groq/compound-mini 编排多步工作流,内置 web 搜索、代码执行与浏览器自动化 —— 适合原本需自定义脚手架的研究/agent 负载。
  • 批处理: 异步 Batch API 享最高 5 折;可提前 24 小时提交,用于批量评估、embedding 或夜间数据摄入。注意:prompt 缓存折扣不与批量折扣叠加。
  • 音频 / 语音套件: Whisper Large V3($0.111/音频小时)与 V3 Turbo($0.04/音频小时)配合 Orpheus TTS(按百万字符计费),同一 API Key 即构成完整语音管线。

⚡ LPU 推理引擎与极致延迟

Groq 的招牌能力是其确定性的低延迟推理:初代 Language Processing Unit(LPU)与新一代 LPX 架构(搭配 NVIDIA 新一代 GPU)在所有支持的模型上都做到了亚秒级首 token 时间和稳定的每秒 token 吞吐。GPT-OSS 20B 在 GroqCloud 达到 1000 token/秒,GPT-OSS 120B 维持 500 t/s,Whisper 转写档以数百倍实时速度处理音频 —— 在同等模型规模下,纯 GPU 云很少能匹配这一指标。四档 service tier(performance / on_demand / flex / auto)把这种延迟特征暴露为可调参数:performance 为企业客户提供严格 SLA,flex 用延迟换更高吞吐,适合非紧急负载。结合 prompt 缓存(GPT-OSS 缓存输入 token 享 5 折)、批量折扣,以及内置 agentic 的 Compound 模型,Groq 将自身定位为实时对话、语音 agent 与高吞吐评估流水线的首选推理层,而非通用模型实验室。

🌐 中国访问与延迟

api.groq.com 从中国大陆不可直接访问 —— API 托管于 Groq 美国数据中心,GFW 同时屏蔽 console.groq.com 与 api.groq.com。国内开发者通常通过 VPN、海外 VPS 或转售 Groq 访问的第三方平台(部分聚合器提供 GPT-OSS 120B、Qwen 3.6 路线并支持中文计费)调用 Groq 模型。在非中国大陆区域,GroqCloud 延迟极佳 —— 美东/美西客户端首 token 时间 100–300ms,OSS 档稳定 500+ t/s。价格本身对海外负载友好,但缺少国内直连通道、没有区域边缘节点,加上近期 Llama 3.1/3.3 移至仅企业档(Contact Sales),使 Groq 仍是高性能海外 API 而非国产替代 —— 服务中国大陆用户的团队应在架构中预留聚合器或代理层。