Google Gemini (Google Gemini)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | 2.5 Pro: $1.25-10/M, 2.5 Flash: $0.15-1.25/M, 2.0 Flash: $0.10/M | 每百万 tokens |
| 输出 (Output) | 2.5 Pro: $5-40/M, 2.5 Flash: $0.30-5/M, 2.0 Flash: $0.40/M | 每百万 tokens |
免费版:2.5 Pro/Flash 有免费 Rate Limit(15-30 RPM),超出按量计费
🤖 支持模型(共 4 个)
✨ 优势
- ✓ Gemini 2.5 Pro 拥有 1M+ Token 超长上下文
- ✓ 多模态原生设计(图文+音视频原生支持)
- ✓ Google Search Grounding 可获取实时信息
- ✓ 免费额度慷慨(2.5 Flash 日常够用)
- ✓ Gemma 开源模型系列有竞争力
- ✓ Vertex AI 支持企业级部署
⚠️ 不足
- × 国内使用需代理
- × API 兼容性不完全(非 OpenAI 格式)
- × 上下文窗口虽大但实际有效利用率存疑
- × 复杂的定价体系(不同上下文有不同费率)
- × Gemini 2.5 Pro 的 output 速率受限严重
🎯 适合场景
超长文档处理;多模态理解;需要实时搜索增强的应用;高免费额度需求场景
💰 价格与方案
| 模型 | 上下文 | 输入 ($/百万 token) | 输出 ($/百万 token) | 最佳用途 |
|---|---|---|---|---|
| Gemini 2.5 Pro(≤200K) | 1M | ¥9.0 | ¥72 | 长文档推理、复杂代码 |
| Gemini 2.5 Pro(>200K) | 1M | ¥18 | ¥108 | 全上下文分析、付费高阶档 |
| Gemini 2.5 Flash | 1M | ¥1.08 | ¥4.32(关闭推理)/¥25.2(开启推理) | 高频调用,性价比首选 |
| Gemini 2.0 Flash | 1M | ¥0.72 | ¥2.88 | 最便宜的 Gemini 文本,批量任务 |
| Gemini 2.0 Flash Lite | 1M | ¥0.18 | ¥0.72 | 超低成本,简单分类 |
| Gemini Embedding | 8K | — | ¥1.08(每百万字符输出) | RAG 向量嵌入 |
| Imagen 4 | — | — | ¥0.29 / 张 | 标准图像生成 |
| Veo 3.1 | — | — | ¥0.72 / 秒 | 短视频生成 |
| Gemma 3(开源权重) | 128K | 自托管 | 自托管 | 本地部署,可微调,无 API 成本 |
🔧 API 与开发者体验
- •API 风格: Google Gen AI SDK(Python/Node/Go/Java/REST)与 Vertex AI 端点 — 默认不兼容 OpenAI 格式,但可通过 OpenRouter、LiteLLM 或自建代理包装层接入。
- •Base URL: https://generativelanguage.googleapis.com/v1beta(Google AI Studio)或 https://{region}-aiplatform.googleapis.com/v1(Vertex AI)。
- •SDK 兼容性: 官方 google-genai SDK 统一接入 Gemini + Imagen + Veo;社区可通过 OpenAI 兼容包装层使用。
- •多模态输入: 单次请求接受文本 + 图像(内联或 File API)+ 音频 + 视频(1M 上下文内最长 60 分钟)— 无需按模态分别调用。
- •流式输出: 文本 SSE token 流;文件/视频生成时流式推送进度;Gemini 2.5 Flash 支持音频输出合成。
- •上下文窗口: Gemini 2.5 Pro / Flash 支持 1M token — 2026 年商业文本 API 中最大;Gemma 3 支持 128K。
- •工具 / 函数调用: 原生函数调用支持 JSON-schema;code_execution 工具提供代码沙箱;内置 Google Search 联网检索(返回引用来源)。
🔍 Google Search 联网检索
Google Search Grounding 是 Gemini API 最具差异化的能力:任何 Gemini 2.x 请求都可以选择开启实时联网检索,模型会同时返回答案与所引用的来源 URL。与需要开发者自建向量数据库并预先摄入文档的 RAG 系统不同,Grounding 每次调用都直接从 Google 索引中拉取最新数据 — 非常适合事实型助手、市场调研机器人、新闻摘要与『本周发生了什么』类工作流。带 Grounding 的响应还包含『搜索入口』,让终端用户可查看模型实际执行的查询语句,便于在面向客户的产品中建立信任。Grounding 按提示单独计费:2.5 Pro 约 35 美元 / 千次 Grounding 提示(与 token 费用分开计费),对 B2B 场景可接受,但高频消费类应用需预留预算。
🌐 中国访问与延迟
Google AI Studio 与 Vertex AI 均无法从中国大陆直接访问 — generative-language API 与 Imagen/Veo 端点都需要稳定代理或 VPN。因此中国大陆用户的延迟本质是代理延迟加上 100–300ms 的 Google API 响应时间,实时多模态对话在大陆网络下难以稳定。境外用户从美/欧访问 Google AI Studio,文本首 token 通常 200–600ms,图像/视频生成启动 1–3s。免费额度(2.5 Pro 5 RPM、2.5 Flash 15 RPM、2.0 Flash 15 RPM、Imagen 4 每日 10 张)足够原型期免信用卡验证,但中国大陆的生产用户通常通过第三方聚合(OpenRouter、LiteLLM 代理或授权转售商)来避免自建代理集群。同时服务中国与全球用户的开发者需维护两条并行集成路径 — 海外直接调用 Google API,国内走聚合路由。