Reka (Reka)

收录于 https://reka.ai

综合排名 #25 ⭐ 可考虑
❌ 无中国大陆直连端点。Reka 注册于美国加州 Sunnyvale(530 Lawrence Expressway),api.reka.ai 是单一全球端点;大陆生产流量需代理或中转,跨太平洋首字节延迟通常 150-250ms。开源权重可自托管(NVIDIA GPU ≥24GB VRAM),规避直连限制。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Reka Edge $0.10/M 输入;Reka Flash $0.80/M;Reka Core $2.00/M;Reka Flash Research 按请求计费($25-$60/千次)。按量付费,无最低承诺。 每百万 tokens
输出 (Output) Reka Edge $0.10/M;Reka Flash $2.00/M;Reka Core $6.00/M。多模态(图像、视频、音频)单独按"每分钟"计费,Flash 模型视频 $0.06/分钟、Core $0.08/分钟;图像按调用计费(Flash $0.01、Core $0.02)。 每百万 tokens
缓存读取 Reka 文档未公布专用"缓存输入"价格——文本 token 计费不区分缓存与全新;多模态按分钟独立计量。 享折扣
💡 免费额度

通过 platform.reka.ai 注册即可获取 API key;Pay-as-you-go 用量计费,不强制最低承诺,可在充值额度内自由试用。无永久免费档、无月赠送额度。

🤖 支持模型(共 5 个)

Reka Core — top-tier multimodal model (text + image + audio + video); input $2.00 / output $6.00 per 1M tokens, image $0.02 / video $0.08 / audio $0.02 per minute Reka Flash — cost-efficient model for everyday tasks (text + image + audio + video); input $0.80 / output $2.00 per 1M tokens, image $0.01 / video $0.06 / audio $0.015 per minute Reka Edge (reka-edge-2603) — ultra-compact on-device model; input $0.10 / output $0.10 per 1M tokens, image $0.005 / video $0.03 per minute, runs on 24GB VRAM GPUs via vLLM Reka Flash Research (reka-flash-research-20250708) — agentic web-research model; $25/1K standard requests, $35/1K parallel-thinking-low, $60/1K parallel-thinking-high Reka Spark — ultra-compact versatile model for embedded/edge devices (referenced on reka.ai product catalog)

✨ 优势

  • 多模态原生:text + image + audio + video 统一 API,单条 message 可混合多模态内容(Reka Flash/Core/Edge 均原生支持)
  • Reka Flash 价格仅 OpenAI 同档 1/5:输入 $0.80/M vs GPT-4.1-mini $0.40/M、Claude Sonnet 4.5 $3/M;多模态按分钟计费,video $0.06/min
  • Reka Edge(reka-edge-2603)面向设备端部署:vLLM 兼容开源权重,GTX 3090 单卡 40-50 tok/s,可绕过云端订阅
  • Reka Flash Research:agentic 网络研究模型(reka-flash-research-20250708),$25/千次标准请求,支持 parallel-thinking 多步推理
  • OpenAI 兼容 API:base_url=https://api.reka.ai/v1,开箱即用 OpenAI Python SDK 与其他兼容客户端
  • Reka Vision / Reka Research / Reka Speech 三个独立产品线 + Reka Edge 在 OpenRouter 上架(无代码切换)
  • 5 位创始人 Dani Yogatama + Cyprien de Masson d'Autume + Mikel Artetxe + Qi Liu + Yi Tay 来自 Google DeepMind / Meta AI 等顶级实验室

⚠️ 不足

  • × 知名度较低:相比 OpenAI/Anthropic/Google 社区采用率仍处早期,文档生态、二方 SDK、教程案例较少
  • × Reka Core 价格 ($2.00/$6.00) 与 Claude Sonnet 4.5 接近,但品牌信任度尚未建立——大客户合同通常优先选已验证供应商
  • × 无中国大陆直连端点,api.reka.ai 是单一全球端点,大陆生产需代理/中转
  • × Reka Flash Research 按"千次请求"计费($25-$60),重度 agent 用户成本不可预测——单次 multi-step research 可能触发多次 parallel-thinking 计费
  • × Reka Spark 虽出现在 reka.ai 产品目录,但公开 API 暂未开放——仅 Edge/Flash/Core 上线 Flash Research
  • × 无中文文档:官网、定价页、API 参考均为英文,大陆团队需要英文工程能力
  • × 无 prompt caching 显式计费——文本 token 不区分缓存与全新,长上下文重复查询成本难以下降

🎯 适合场景

需要在一个 API 里同时跑文本、图像、音频、视频的团队:希望多模态原生集成(不必为视觉/语音单独接 OpenAI/Anthropic/Gemini),希望降低单 token 价格,并愿意评估知名度较低但技术背景强(前 Google DeepMind / Meta AI 创始人团队)的供应商。

💰 价格与方案

模型输入 ($/M)输出 ($/M)图像 (每次)视频 (每分钟)音频 (每分钟)备注
Reka Edge$0.10$0.10$0.005$0.03N/A超轻量;vLLM 兼容开源权重;适合端侧/边缘部署
Reka Flash$0.80$2.00$0.01$0.06$0.015高性价比主力模型;支持文本+图像+音频+视频
Reka Core$2.00$6.00$0.02$0.08$0.02面向复杂多模态推理的旗舰模型
Reka Flash Research (reka-flash-research-20250708)$25 / 千次 (标准)$35 / 千次 (parallel-low)$60 / 千次 (parallel-high)agentic 网络研究模型;按请求计费;支持多步并行推理

🔧 API 与开发者体验

  • 接口风格: OpenAI 兼容 REST API,base_url=https://api.reka.ai/v1——可直接替换,官方 OpenAI Python SDK、curl、Go、Java、JS 客户端都无需额外胶水代码。
  • 模型接口: 三款 chat 模型(Reka Edge / Flash / Core)通过 /v1/chat/completions 与 /v1/models 暴露;Reka Flash Research 通过类 agent 端点提供,按请求计费。
  • 原生多模态: 单条 message 可混合文本 + 图像 + 音频 + 视频;无需额外 OCR/STT/说话人分离 API——Reka 的 chat completions 直接接收多模态内容块。
  • 开源权重 + vLLM: Reka Edge 可本地通过 vLLM 0.15.x 在 ≥24GB VRAM 的 NVIDIA GPU 上跑(GTX 3090 已验证 40-50 tok/s),自托管路径绕过 api.reka.ai 速率限制,适合离线/私有部署。
  • MCP 服务器: 托管 MCP 服务器(https://docs.reka.ai/_mcp/server)将 Reka Vision 与 chat 能力暴露给 Claude Code、Cursor 等 MCP-aware 客户端,可与 Mixedbread Vision MCP 直接对标。
  • OpenRouter 上架: Reka Edge 已在 OpenRouter 上架(来源 reka.ai/news/switch-models-zero-code-changes-reka-edge-now-available-on-openrouter),可通过 OpenRouter 做跨厂商 failover 而无需改代码。
  • 鉴权与上手: 在 platform.reka.ai 注册即可获得 X-Api-Key,充值后立即使用 chat completions;纯按量、无最低承诺。

🌐 原生多模态:一个 API 覆盖文本、图像、音频、视频

大多数 LLM API 把多模态分成独立端点(OpenAI /v1/audio + /v1/images、Google 分 Vision/Audio、Anthropic 无原生 audio)。Reka 判断:多模态是模型本身,不是特性开关。Reka Edge/Flash/Core 都接受单条 message 里的图像、视频、音频块,无需额外 OCR/STT/帧抽取。定价对应模态:文本按百万 token(Edge $0.10/$0.10、Flash $0.80/$2.00、Core $2.00/$6.00),图像按次($0.005-$0.02),视频/音频按分钟($0.03-$0.08 与 $0.015-$0.02)。Flash Research 叠加 agentic 网络研究(标准 $25/千次;parallel-thinking $35-$60/千次),与 Perplexity Sonar 和 OpenAI deep-research 在价格上正面竞争。再叠加 vLLM 可部署的 Reka Edge 开源权重(GTX 3090 单卡 40-50 tok/s),得到少见的、不被任何云厂商锁定的生产级多模态栈。

🌍 区域可用性与延迟

Reka 总部位于加州 Sunnyvale 530 Lawrence Expressway(Reka, Inc.,2022 年成立),工程团队在湾区。api.reka.ai 是单一全球端点,北美/欧洲首字节延迟低;中国大陆无法保证直连,生产流量通常需要代理或中转,跨太平洋首字节延迟约 150-250ms。Reka Edge 开源权重是强力兜底:单张 ≥24GB VRAM NVIDIA GPU(已在 GTX 3090 上验证)可通过 vLLM 0.15.x 以 40-50 tok/s 跑模型,需要中国大陆驻留或低于 50ms 延迟的团队可直接自托管。Reka Vision 有独立的视频按分钟计费和 MCP 服务器端点。Reka Edge 同时在 OpenRouter 上架做跨厂商 failover;Flash Research 在美国托管推理上增加 agentic 搜索层。