TwelveLabs API 2026 评测:视频理解与 Marengo 检索

TwelveLabs(twelvelabs.io)是一家位于美国旧金山的 AI 创业公司,专注于构建专用视频理解 API。公司 2026 年完成 1 亿美元 B 轮融资,是全球融资规模最大的纯视频 AI 公司之一。旗舰产品是 Pegasus 模型家族(Pegasus 1.5 在产,Pegasus 1.2 作为低成本前代版本)和 Marengo 视频基础模型(Marengo 3.0,27B 参数),两层叠加覆盖了从「这段视频里有什么」到「找到演讲者提到 X 的那一刻」的完整链路。对于 2026 年 8 月评估视频理解 API 的工程师,TwelveLabs 的关键价值在于:它是目前唯一一家把画面帧、时间序列、语音音频和屏幕文字在一次前向中联合编码并输出自然语言描述的第一方供应商,而且免费 600 分钟额度足以跑通中型 PoC,无需信用卡。完整对比见 TwelveLabs 厂商页面

🌍 速览:TwelveLabs 是 2026 年视频理解 API 的领跑者。Pegasus 1.5 通过画面+音频+语音+屏幕文字的联合编码返回连贯的视频摘要;Marengo 3.0 生成多模态 embeddings 支持 any-to-any 检索。免费 600 分钟额度(无需信用卡),Developer 计划按量计费、无月费。按分钟计费(非 token)意味着成本模型需要按视频重新建模。没有中国大陆直连端点。

TwelveLabs 是什么?2026 年为什么重要?

TwelveLabs 是一家 2021 年成立于旧金山的 AI 创业公司,专注于视频理解(不是视频生成)。通过 REST API(api.twelvelabs.io/v1.3),开发者可以提交视频、获取索引,然后对索引运行四类核心操作:

  1. Search —— 跨索引的自然语言或示例检索(找出匹配「演讲者提到定价的那一刻」的片段);
  2. Embed —— 生成 Marengo 多模态 embeddings 供下游 RAG 管线使用;
  3. Analyze —— 调用 Pegasus 对视频做分类、分段或结构化信息抽取;
  4. Gist —— 调用 Pegasus 生成视频的自然语言摘要。

它在 2026 年视频 AI 市场中的定位:

  1. 多模态融合是核心卖点。Pegasus 1.5 在一次 transformer 前向中联合编码画面帧、时间序列、语音音频和屏幕文字。竞品往往采用后期拼接方案,会丢失语音与画面变化之间的因果关系。
  2. Marengo 是底层基础。Marengo 3.0 是 27B 参数的视频基础模型,产出的 embeddings 覆盖全部四种模态,支持 any-to-any 检索:text-to-video、video-to-video、image-to-video、audio-to-video。
  3. 开发者生态成熟。官方 SDK 覆盖 Python / Node / Go / Java,OpenAPI 3 规范,AI 智能体可用的 MCP 服务器(Claude Code、Cursor),Playground,以及 2026 年 1 亿美元 B 轮融资带来的企业级稳定性。

本文从 2026 年 8 月工程师集成视角覆盖 TwelveLabs API:Pegasus 1.5 / 1.2 模型系列、Marengo 3.0 嵌入模型、按分钟计费结构、索引与 Search / Embed / Analyze 工作流,以及与 OpenAI GPT-4o、Google Gemini 2.5 Pro 视频输入、生成类 API(KlingLumaRunway)的对比。需要横向对比表的话,视觉理解对比 列出了 TwelveLabs 与 GPT-4o、Gemini、Claude 在图像+视频任务上的位置关系。

TwelveLabs 模型矩阵(2026)

TwelveLabs 当前在两个层级共生产 3 个模型:

模型 层级 输出 适用场景
Pegasus 1.5生成 / 分析(旗舰)自然语言 gist、分类、结构化抽取多模态融合要求高的生产环境视频理解
Pegasus 1.2生成 / 分析(前代)与 1.5 相同,融合精度较低对成本敏感的工作负载;相同 API 表面,单价更低
Marengo 3.0嵌入基础模型(27B 参数)多模态 embeddings(画面/音频/语音/文字)RAG、any-to-any 检索、跨视频搜索

Pegasus 1.5 与 Pegasus 1.2 共用同一 API 表面和按分钟计费结构 —— 差距在多模态融合质量。Marengo 3.0 是独立模型用于检索:对已索引视频调用 POST /embed 即可获得 embedding 向量,可存入任何向量数据库(Pinecone、Weaviate、Qdrant、Chroma,或者内存 numpy 数组)。

TwelveLabs 计费:按视频分钟,按文本 token

TwelveLabs 在视频 AI API 中比较独特 —— 它按输入视频的分钟数计费,不是按 token。这更符合人类对视频成本的直觉(10 分钟视频成本是 1 分钟视频的 10 倍),也比 token 模型更容易预测。价格核验时间 2026-08-18,来源:twelvelabs.io/pricing

组件 价格 计费时机 备注
视频索引$0.042/分钟索引时一次性Pegasus 1.2 / 1.5 共用同一索引价
输入视频$0.021/分钟每次 API 调用Search、Analyze、Segment、RAG 调用
输出文本$0.0075/千 tokens每次调用Pegasus 自然语言生成
Marengo embedding 基础设施$0.0015/已索引分钟/月月度循环索引存储费用 —— 与一次性索引费分开
注册免费额度600 分钟累计足够跑通中型项目,无需信用卡
Developer 计划订阅$0/月超出免费额度后按用量计费,无最低消费

具体成本示例:100 小时视频档案,索引一次($0.042 × 6,000 = $252),每月 1,000 次 5 秒片段查询($0.021 × ~83 小时输入 = $1.74)+ 输出文本按 $0.0075/千 tokens。存储 $0.0015/已索引分钟/月 = $9/月。所以 100 小时档案每月 1,000 次查询的总成本约为 $263 一次性 + $10/月循环。比起用 GPT-4o 视频输入(按帧 token + 调用次数计费)搭同样的管线,TwelveLabs 在长视频反复查询同一档案的场景下通常更便宜。

TwelveLabs API 实际工作流

TwelveLabs API 采用异步索引任务模型:提交视频(或引用已有资产)→ 轮询索引状态 → 对索引调用 Search / Embed / Analyze。MCP 服务器 https://docs.twelvelabs.io/_mcp/server 让 Claude Code 和 Cursor 可以直接调用 Search / Analyze / Embed,无需写集成代码。

第一步:索引视频。POST 视频文件或 URL 到 /v1.3/tasks,API 返回 task ID;轮询 GET /v1.3/tasks/{task_id} 直到状态为 ready。典型索引延迟:5 分钟片段 30 秒,1 小时视频数分钟。

第二步:检索索引。索引就绪后,POST 文本或图像查询到 /v1.3/search,API 返回按相关度排序的匹配片段(带时间戳)。例如对已索引的产品演示查询「演讲者提到定价的那一刻」,即便画面上没有任何视觉提示,也能返回精确的 12 秒片段。

第三步:生成 embeddings。对已索引视频调用 POST /v1.3/embed,获得 Marengo 3.0 多模态 embeddings。存入任意向量数据库,与文本 embeddings 结合做混合检索。

第四步:运行分析。调用 POST /v1.3/analyze 做结构化抽取(分类、命名实体、按时间戳的情感),或调用 POST /v1.3/gist 让 Pegasus 生成自然语言摘要。

官方 Python SDK(PyPI 上的 twelvelabs)把四步封装成单个客户端类,并提供常见模式的辅助方法。例如 client.task.index(video_file="demo.mp4") 启动索引,client.search.query(index_id=..., query="演讲者提到定价的那一刻") 返回排序后的片段。完整 API 参考见 docs.twelvelabs.io/api-reference

TwelveLabs vs OpenAI vs Gemini vs 视频生成 API

TwelveLabs 占据视频理解这一专门细分赛道,与通用多模态 LLM(OpenAI GPT-4o、Google Gemini 2.5 Pro)有重叠,与视频生成 API(Kling、Luma、Runway、Veo)是互补关系。各类别定位如下:

能力 TwelveLabs OpenAI GPT-4o Gemini 2.5 Pro Kling / Luma / Runway
生成视频是(主营)
理解小时级长视频是(专长)有限(抽帧)是(最长 2h)N/A
时间精确的片段检索是(核心)近似N/A
多模态 embeddings(画面+音频+语音+文字)是(Marengo 3.0)否(仅文字+图像)部分
语音感知搜索是(原生)需独立 ASR是(原生)N/A
免费层600 分钟有限 API 额度有限免费层有限免费积分
中国接入需代理需代理需代理 / Vertex AIKling 可中国直连

2026 年生产级视频 AI 栈的常见组合是:TwelveLabs 做理解 + 生成 API(Kling、Luma、Runway)做生成。两端互补:生成 API 用文本或图像产出新视频;TwelveLabs 把已有视频变得可检索、可结构化、可问答。TwelveLabs 与 OpenAIAnthropic 是专家预处理器的关系 —— 先用 TwelveLabs 找到相关片段或生成 gist,再把文本喂给通用 LLM 做下游推理。

需要注意的限制

  • 按分钟计费要求视频感知成本模型。1,000 小时监控档案与 1,000 小时文本语料在经济上不可类比;TwelveLabs 按分钟计费,账要重算。
  • 索引是异步的。5 分钟片段典型 30 秒,小时级视频数分钟。不适合实时生成场景(这类请用 Kling / Luma)。
  • 无中国大陆端点。中国生产部署需要代理或 Enterprise 私有部署。
  • Pegasus 1.5 vs 1.2 边际收益有限。纯文本或纯画面任务上 1.5 优势不明显;1.5 的优势在多模态联合场景。
  • Knowledge Store / Agents 仍在研究预览。跨视频问答 API 表面可能在正式发布前变动。
  • 无函数调用 / 工具使用。TwelveLabs 是专家理解 API,不是 LLM。下游推理需配合 GPT-4o / Claude / 本地 LLM。
  • 无联盟推广计划。不像 Cloudflare、OpenRouter 或其他一些厂商,没有分成机制。

结论

TwelveLabs 是「视频理解是主要任务」场景下的首选 —— 课程搜索、监控档案检索、广告素材问答、体育素材索引、培训视频导航。600 分钟免费额度慷慨到可以先验证用例再付费。视频是多源之一的多模态 RAG 场景,TwelveLabs + 通用 LLM 是 2026 年的标准模式。纯视频生成请用 Kling、Luma 或 Runway。纯文本 LLM 场景,TwelveLabs 不适用。

优势:长视频的时间精确片段检索、画面+音频+语音+文字联合融合、PoC 阶段 600 分钟免费额度、SDK 与 MCP 服务器成熟。

短板:无中国大陆端点、不支持实时响应、按分钟计费要求新成本模型、无函数调用做下游工具调用。


数据核验 2026-08-18:TwelveLabs 价格与模型系列来源官方 twelvelabs.io/pricing(Pegasus 1.2 / 1.5、Marengo 3.0);API 表面与端点列表来源 docs.twelvelabs.io/api-reference(v1.3 REST API);免费计划 600 分钟细节来源 twelvelabs.io/pricing FAQ;B 轮融资消息来源 twelvelabs.io 首页。与 TwelveLabs 无联盟关系。