Gemini 多模态 (Gemini Multimodal)

收录于 https://ai.google.dev/gemini-api/docs/multimodal

综合排名 #4 ⭐⭐ 推荐
❌ 需代理(Google AI Studio 在中国大陆不可直接访问,需稳定代理) | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Omni Flash: $0.15/M input tokens (multimodal); Nano Banana 2 Lite: $0.034/1K image tokens; Veo 3.1: $0.10/sec video 每百万 tokens
输出 (Output) Omni Flash: $0.60/M output tokens (multimodal); Nano Banana Pro: $0.12/1K image tokens 每百万 tokens
💡 免费额度

Free tier: Gemini Omni Flash 15 RPM, Veo 3.1 2 generations/day, Imagen 4 10 images/day — no credit card required

🤖 支持模型(共 5 个)

Gemini Omni Flash (multimodal, 1M context, audio+video+text) Nano Banana 2 Lite (image generation, $0.034/1K tokens) Nano Banana Pro (image generation, $0.12/1K tokens) Veo 3.1 (video generation, $0.10/sec) Imagen 4 (image generation, $0.04/image)

✨ 优势

  • Gemini Omni Flash 是 Google 首个原生支持音频+视频+文本混合输入的多模态主力模型
  • Nano Banana 2 Lite 是 Google 在 2026-06 推出的轻量图像生成模型($0.034/1K 图像 tokens)
  • Veo 3.1 与 Imagen 4 提供同一 API 内的视频+图像生成能力,与 Omni Flash 形成『理解+生成』完整链路
  • Free tier 覆盖 15 RPM Omni Flash + 每日 2 次 Veo 3.1 视频生成,足以做小批量产品验证
  • 1M token 上下文窗口可一次性处理 60 分钟视频+音频+字幕,无需切片

⚠️ 不足

  • × 国内访问需代理(Google AI Studio 与 Google Cloud 不在大陆开放)
  • × 定价分层较复杂,Veo 3.1 视频按秒计费成本难预测
  • × Omni Flash 在长上下文(>500K)下延迟显著上升
  • × Imagen 4 与 Veo 3.1 在某些地区受版权与人物肖像限制
  • × Gemini Omni Flash 不是 OpenAI 格式 API,必须用 Google Gen AI SDK 或 REST 直调

🎯 适合场景

多模态理解(视频/音频/图像+文本);产品级图像/视频生成;Google 生态与 Vertex AI 集成

💰 价格与方案

模型 / 能力计费单位价格最佳用途
Gemini Omni Flash(输入)百万 token$0.15长上下文多模态理解
Gemini Omni Flash(输出)百万 token$0.60推理 + 结构化输出
Nano Banana 2 Lite(图像)千 image tokens$0.034高频低成本图像生成
Nano Banana Pro(图像)千 image tokens$0.12生产级图像生成
Imagen 4(图像)每张图$0.04标准图像生成
Veo 3.1(视频)每秒$0.10短视频生成

🔧 API 与开发者体验

  • API 风格: Google Gen AI SDK(Python/Node/Go/Java/REST)与 Vertex AI 端点 — 默认不兼容 OpenAI 格式,但可通过 OpenRouter、LiteLLM 等 OpenAI 兼容包装层接入。
  • Base URL: https://generativelanguage.googleapis.com/v1beta(Google AI Studio)或 https://{region}-aiplatform.googleapis.com/v1(Vertex AI)。
  • SDK 兼容性: 官方 google-genai SDK 统一接入 Gemini + Imagen + Veo;社区可通过 OpenAI 兼容包装层使用。
  • 多模态输入: 单次请求接受文本 + 图像(内联或 File API)+ 音频 + 视频(1M 上下文内最长 60 分钟)— 无需按模态分别调用。
  • 流式输出: 文本 SSE token 流;文件/视频生成时流式推送进度;Omni Flash 支持音频输出合成。
  • 上下文窗口: Omni Flash 支持 1M token(单次请求约 60 分钟视频 + 音频 + 字幕)— 2026 年商业 API 中最大。
  • 工具 / 函数调用: 原生函数调用支持 JSON-schema;code_execution 工具提供代码沙箱;内置 Google Search 联网检索。

🎬 1M 上下文原生多模态

Gemini Omni Flash 是 2026 年唯一一款原生支持音频 + 视频 + 图像 + 文本在单次请求中输入(无需预处理或切片)的商业旗舰 API。1M token 上下文足以容纳约 60 分钟视频及其音轨与字幕,开发者可直接上线『看视频回答』类产品功能,无需自建抽帧流水线。图像与视频生成(Imagen 4、Nano Banana 2 Lite/Pro、Veo 3.1)位于同一端点,同一个 API Key 覆盖完整的『理解 + 生成』闭环 — 对希望把多模态对话与内容生成绑定到同一计费关系的产品团队尤为友好。代价是 API 风格:Google Gen AI SDK 与 Vertex AI 默认不兼容 OpenAI 格式,从 OpenAI 技术栈迁移需要包装层(OpenRouter、LiteLLM 或自建适配器)。

🌐 中国访问与延迟

Google AI Studio 与 Vertex AI 均无法从中国大陆直接访问 — generative-language API 与 Imagen/Veo 端点都需要稳定代理或 VPN。因此中国大陆用户的延迟本质是代理延迟加上 100–300ms 的 Google API 响应时间,实时多模态对话在大陆网络下难以稳定。境外用户从美/欧访问 Google AI Studio,文本首 token 通常 200–600ms,图像/视频生成启动 1–3s。免费额度(Omni Flash 15 RPM、Veo 3.1 每日 2 次、Imagen 4 每日 10 张)足够原型期免信用卡验证,但中国大陆的生产用户通常通过第三方聚合(OpenRouter、LiteLLM 代理或授权转售商)来避免自建代理集群。同时服务中国与全球用户的开发者需维护两条并行集成路径 — 海外直接调用 Google API,国内走聚合路由。