TwelveLabs (TwelveLabs)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | Free plan: 600 minutes video indexing + API usage (Pegasus 1.2 $0.042/min indexing one-time, $0.021/min input video, $0.0075/1k tokens output text, $0.0015/min monthly embedding infrastructure). Developer plan: paid overage, 90-day index retention lifted to unlimited. | 每百万 tokens |
| 输出 (Output) | Same per-minute and per-1k-tokens billing. Marengo embeddings billed separately by indexed minute. | 每百万 tokens |
免费计划:注册即获 600 分钟视频索引额度(一次性累积额度),可调用全部核心 API(Pegasus 1.2/1.5、Marengo 3.0、Search、Embed、Analyze & Segment)。索引数据保留 90 天;升级 Developer 计划后索引保留变为无限。
🤖 支持模型(共 3 个)
✨ 优势
- ✓ 视频理解(Video Understanding)品类的领跑者:Pegasus 同时分析画面帧 + 时间序列 + 语音 + 屏幕文字,给出自然语言描述
- ✓ Marengo 3.0 是 27B 参数的视频基础模型,支持帧/音频/语音/文本多模态 embeddings + any-to-any 检索
- ✓ RESTful API + 官方 Python/Node/Go/Java SDK,OpenAPI 3 规范,Async indexing task 模型(POST 创建 → 轮询 → 拉结果)
- ✓ 面向开发者友好的 Playground 与 MCP 服务器集成(Claude Code / Cursor 可直接调用)
- ✓ 知识库(Knowledge Store)+ 智能体(Agents Research Preview):上传视频 → 自动分块 → 跨视频问答与检索
- ✓ 2026 年 Series B 1 亿美元融资,估值进入独角兽行列(企业视频 AI 赛道头部)
- ✓ 免费 600 分钟额度可完整跑通中小型视频理解 PoC,无需信用卡
⚠️ 不足
- × 按视频分钟计费(非 token 计费),长视频(监控 / 体育 / 电影)的成本估算需要重新建模
- × 索引任务异步轮询,平均 30 秒-几分钟才能返回结果,不适合实时生成场景
- × 无中国大陆直连节点,国内生产部署需要代理或海外节点
- × Pegasus 1.5 相比 1.2 提升主要在多模态融合质量,对纯文本/纯画面场景边际收益小
- × Knowledge Store / Agents 仍在 Research Preview,API 可能变动
- × 不支持函数调用/工具使用 —— 纯视频理解类 API,需配合 LLM 编排(OpenAI / Claude / Kimi)做下游任务
- × 无联盟推广计划
🎯 适合场景
需要对视频内容做语义理解/搜索/结构化的团队(媒体档案、监控、体育赛事、教育课程、企业培训视频);需要给 LLM 提供长视频上下文(用 Marengo 检索片段再喂给 Claude/GPT)的 RAG 系统;广告/电商视频内容审核(画面+语音联合判断);与 Kling/Luma/Runway 等生成 API 互补:前者负责生成,后者负责理解
💰 价格与方案
| 计费项 | 免费计划 | Developer 计划 | 备注 |
|---|---|---|---|
| 视频索引(一次性,按分钟) | $0.042/分钟 | $0.042/分钟 | Pegasus 1.2 / 1.5 — 索引建立时一次性收取 |
| 输入视频(按分钟/调用) | $0.021/分钟 | $0.021/分钟 | Pegasus 1.2 — Analyze & Segment、Search、RAG 调用 |
| 输出文本(每千 tokens) | $0.0075/千 | $0.0075/千 | Pegasus 1.2 — 自然语言输出 |
| Embedding 基础设施(按月) | $0.0015/分钟 | $0.0015/分钟 | 按每月已索引分钟数计费 |
| Marengo 3.0 embeddings | 按分钟 | 按分钟 | Search / RAG 检索同样按已索引分钟计费 |
| 索引保留期 | 90 天 | 无限期 | 免费计划 90 天后索引自动清除;Developer 计划无此限制 |
| 月费订阅 | $0 | $0 | Developer 计划纯按量计费,无最低消费 |
| 注册免费额度 | 600 分钟(累计) | — | 足够跑通中型视频理解 PoC |
| 企业合同 | — | 可申请 | 批量折扣、自定义限速、私有部署 |
🔧 API 与开发者体验
- •API Surface: RESTful JSON API at https://api.twelvelabs.io/v1.3. Standard verbs (GET / POST / PUT / DELETE). Auth via x-api-key header. Returns X-Api-Version on every response. Compatible with any language that speaks HTTP; official SDKs remove boilerplate.
- •Official SDKs: Python (twelvelabs-python on PyPI), Node.js, Go, Java, plus a community Ruby SDK. All four first-party SDKs are thin wrappers around the same REST surface and include example notebooks for indexing, search, and embedding tasks.
- •Indexing Workflow: Asynchronous task model: POST /v1.3/tasks to upload a video (or reference an existing asset) → poll GET /v1.3/tasks/{task_id} until status is 'ready' → call Search / Embed / Analyze on the indexed video. Typical indexing latency: 30s for a 5-minute clip; several minutes for hour-long content.
- •Endpoints of Note: POST /tasks (create indexing task), POST /search (any-to-any search across indexes), POST /embed (generate Marengo embeddings), POST /analyze (run Pegasus on a video), POST /gist (Pegasus-generated natural-language summary), POST /knowledge-stores (cross-video Q&A in research preview).
- •MCP Server: TwelveLabs exposes an MCP server at https://docs.twelvelabs.io/_mcp/server so AI agents like Claude Code and Cursor can call Search / Analyze / Embed directly from a chat session — useful for prototyping RAG pipelines before writing integration code.
- •Rate Limits: Rate limits scale with monthly spend (documented in API docs as 'Rate limits apply and scale with monthly spend'). Free plan: low concurrency cap. Developer plan: higher concurrency. Enterprise: negotiated. 429 returned with Retry-After header when exceeded.
- •Error Handling: Standard HTTP codes (200 / 201 / 400 / 401 / 404 / 429). Errors include machine-readable 'code' field and human-readable 'message'. SDKs raise typed exceptions with these fields so callers can branch on error class without parsing strings.
🎥 视频理解能力
TwelveLabs 是 2026 年视频理解 API 的领跑者,其旗舰 Pegasus 模型是唯一在生产环境中同时融合画面帧、时间序列、语音和屏幕文字并输出自然语言描述的模型。Pegasus 一次调用就能返回对视频的连贯总结:场景、说话人、动作、屏幕文字,并用因果语言串起来。Pegasus 1.5 是当前生产版本,相比 1.2 把四种流的联合编码从「后拼接」改为「一次性 transformer 融合」,这是「描述场景」与「描述发生了什么、为什么发生」之间的关键差异。检索侧由 Marengo 3.0(27B 参数视频基础模型)提供多模态 embeddings —— 同时编码视觉与声学上下文 —— 让「演讲者提到定价那一刻」这种文本查询即便画面上没有任何视觉提示也能返回正确的视频片段。
🌐 区域可用性与延迟
TwelveLabs 是位于美国旧金山的公司,公共 API 托管在 AWS us-west-2 和 us-east-1。没有中国大陆区域节点,也没有官方的中国接入方案。中国生产环境的流量必须通过海外节点代理,或者在 Enterprise 合同下在客户选择的 AWS 区域部署私有实例。5 分钟视频的索引延迟通常 30 秒;1 小时视频通常需要数分钟。Search 和 Analyze 调用是同步 HTTP,在模型推理时间之上额外增加 1-3 秒网络往返。异步索引模型意味着「提交 + 轮询」的工作流,而非请求-响应模式 —— 适合批量管线,但不适合实时视频生成场景(实时生成请用 Kling / Luma 等生成类 API)。