Morph (Morph)
💰 Token 价格
| 类型 | 价格 | 备注 |
|---|---|---|
| 输入 (Input) | 按模型分别计费,按每 1M 输入 token 计(文本模型)。从 llms.txt 验证(2026-08-28):Kimi K3 $2.90、Qwen 3.5 397B $0.50、GLM-5.2 744B $1.10、GLM-5.3-Flash $0.15、MiniMax M3 $0.30、MiniMax M2.7 $0.279、DeepSeek V4 Flash (beta) $0.12、Qwen 3.8/3.6 27B $0.289、Gemma 4 31B $0.14。Qwen 3.5 397B 缓存输入 $0.30 per 1M(其他模型无独立缓存价)。Fast Apply 用 `auto` 模型按 prompt+completion 两档计(OpenRouter 验证 morph-v3-fast $0.0008/$0.0012 per 1k、morph-v3-large $0.0009/$0.0019 per 1k),Compact、Reflexes、WarpGrep 与 Router 按事件计费(详见 pricingEN)。 | 每百万 tokens |
| 输出 (Output) | 按模型分别计费,按每 1M 输出 token 计(文本模型)。从 llms.txt 验证:Kimi K3 $14.00、Qwen 3.5 397B $3.50、GLM-5.2 744B $4.10、GLM-5.3-Flash $0.50、MiniMax M3 $1.20、MiniMax M2.7 $1.20、DeepSeek V4 Flash (beta) $0.278、Qwen 3.8/3.6 27B $2.40、Gemma 4 31B $0.40。Fast Apply 输出按 morph-v3-fast $1.20 / morph-v3-large $1.90 per 1M token;Fast Apply 用 `auto` 推荐档(5,000-10,500 tok/s, ~98% 精度)按实际路由模型分档计费。Kimi K3 `service_tier: standby` 走 GLM-5.2 同等待遇,标准按 token 计。 | 每百万 tokens |
| 缓存读取 | Qwen 3.5 397B 缓存输入折扣价 $0.30 per 1M(折扣 40%);其他开放权重模型无独立缓存价(llms.txt: 'the other models have no separate cache rate')。Fast Apply / Compact / Reflexes / WarpGrep / Router 按事件或按 token 计费,无缓存档。 | 享折扣 |
无永久免费档(无零元 starter plan)。新用户注册即可获得 API key 并按 pay-as-you-go 充值;官方为初创公司提供 Startup Credits(最高 $5,000),但需单独联系销售申请。Morph 主页明确「Start free. Get API Key」,但实际计费从首次 token 调用开始。
🤖 支持模型(共 13 个)
✨ 优势
- ✓ 推理专为 Agent 设计:Fast Apply / Compact / WarpGrep / Reflexes / Model Router 五件套端到端覆盖 agent loop(edit → search → compress → monitor → route)
- ✓ OpenAI + Anthropic 双协议:一个 API key 同时跑 OpenAI Chat Completions 与 Anthropic Messages(含 Claude Code 与 Codex 集成)
- ✓ Open-weight 旗舰模型阵容:Kimi K3 (2.8T) + GLM-5.2 (744B MoE) + Qwen 3.5 397B + DeepSeek V4 Flash + MiniMax M3/M2.7 + Gemma 4 + Qwen 3.8/3.6
- ✓ Fast Apply 速度:morph-v3-fast 10,500 tok/s, 96% 精度;morph-v3-large 5,000 tok/s, 98% 精度;`auto` 档智能路由
- ✓ Compact 33,000 tok/s 上下文压缩:100k token < 2 秒,保留 `<keepContext>` 标签内容 byte-for-byte 一致
- ✓ WarpGrep 语义代码搜索 subagent:~6 秒/查询,自带 grep_search / read / list_directory / glob / finish 工具
- ✓ Reflexes 11 个内置分类器(jailbreak / guardrail / leaked-thinking / stuck-in-a-loop / ambiguity / difficulty 等),~90 ms 内出标签
- ✓ Claude Code / Codex / Cursor 一键接入:MCP server `npx @morphllm/morphmcp@latest` 暴露 edit_file / codebase_search / github_codebase_search 工具
- ✓ Y Combinator 背书:Y Combinator logo + 'Backed by Y Combinator' 出现在 morphllm.com 页脚;OpenRouter Top 25 provider;100B+ tokens/day、400+ 生产 agent
⚠️ 不足
- × 无大陆端点:API base URL https://api.morphllm.com 单端点无大陆/亚太区域,中国生产流量延迟 200-400 ms
- × 无月度订阅 / 无永久免费档:纯 pay-as-you-go + Startup Credits(≤$5K)单独申请;评估周期需自垫
- × 定价主要面向 agent 高频调用:旗舰 Kimi K3 2.8T $2.90/$14.00 per 1M,远高于通用 chat 模型价格档
- × Fast Apply 必须使用专属 prompt 模板 `<instruction>{...}</instruction><code>{...}</code><update>{...}</update>` 才能拿到合并结果,不是 drop-in 的 OpenAI 替换
- × WarpGrep 需本地工具执行循环:API 返回 tool_calls,开发者需在自己的文件系统上 grep / read / list / glob 然后回传(3-6 轮对话)
- × GLM-5.2 `service_tier: standby` 在利用率 >25% 时直接 429,不保证 SLA;不适合延迟敏感的交互流量
- × Compact / WarpGrep / Reflexes / Router 是 OpenAI 格式独占:不支持 Anthropic Messages 协议(仅文本模型双协议)
- × 公司 2026 才 浮出水面(YC 阶段,AutoInfra, Inc.):社区生态、第三方 SDK、教程都比 OpenAI / Anthropic / DeepSeek 薄
- × 无 affiliate 合作计划:无合作伙伴收入分成(cf. Cloudflare / OpenRouter)
🎯 适合场景
构建生产级 coding agent / 长期运行 agent 的团队,需要 Fast Apply (10,500 tok/s 代码合并) + Compact (33,000 tok/s 上下文压缩) + WarpGrep (~6s 代码搜索) + Reflexes (jailbreak / stuck-in-loop 监控) + Model Router 一站式的开发者;想要 Claude Code / Codex / Cursor 通过 MCP 接入并切换到 Kimi K3 / GLM-5.2 / Qwen 3.5 397B 开源权重模型的团队;需要 Anthropic 协议接入的开源权重推理场景;评估预算可通过 Startup Credits (≤$5K) 申请的初创公司。
💰 价格与方案
| 产品 / 模型 | 计费单位 | 输入 | 输出 | 备注 |
|---|---|---|---|---|
| Kimi K3 2.8T (morph-kimik3) | 按 1M token | $2.90 | $14.00 | 旗舰 Fable 档;1M 上下文;~100 tok/s |
| Kimi K3 Fast (morph-kimik3-fast) | 按 1M token | $6.00 | $22.50 | 最快 Kimi K3 档;同 1M 上下文 |
| Qwen 3.5 397B (morph-qwen35-397b) | 按 1M token | $0.50(缓存 $0.30) | $3.50 | 262k 上下文;~180 tok/s;缓存输入 40% 折扣 |
| GLM-5.2 744B (morph-glm52-744b) | 按 1M token | $1.10 | $4.10 | 1M 上下文;~80 tok/s;支持 service_tier standby |
| GLM-5.3-Flash (morph-glm53flash) | 按 1M token | $0.15 | $0.50 | 1M 上下文;高量 agent 预算档 |
| MiniMax M3 428B (morph-minimax3-428b) | 按 1M token | $0.30 | $1.20 | 256k 上下文;~90 tok/s MoE |
| MiniMax M2.7 230B (morph-minimax27-230b) | 按 1M token | $0.279 | $1.20 | 196k 上下文;~90 tok/s MoE |
| DeepSeek V4 Flash beta (morph-dsv4flash) | 按 1M token | $0.12 | $0.278 | 1M 上下文;~150 tok/s;亚秒级首 token |
| Qwen 3.8 / 3.6 27B | 按 1M token | $0.289 | $2.40 | 131k 上下文;~100 tok/s dense |
| Gemma 4 31B (morph-gemma4-31b) | 按 1M token | $0.14 | $0.40 | 175k 上下文;~120 tok/s dense |
| Fast Apply (morph-v3-fast) | 按 1k token(OpenRouter) | $0.0008 | $0.0012 | 10,500 tok/s;96% 编辑精度;推荐 `auto` |
| Fast Apply (morph-v3-large) | 按 1k token(OpenRouter) | $0.0009 | $0.0019 | 5,000 tok/s;98% 编辑精度 |
| Compact (morph-compactor) | 按事件 / 按 token | n/a | n/a | 33,000 tok/s;100k token < 2s;<keepContext> 标签内容 byte-for-byte 保留 |
| WarpGrep (morph-warp-grep-v2.1) | 按请求 | n/a | n/a | 每查询 ~6s;内置 grep/read/list/glob/finish 工具 |
| Reflexes(实时) | 按事件 | $0.001 → $0.0005 | n/a | 11 个内置分类器;~90 ms 出标签;1M 事件分级折扣 |
| Reflexes(异步批) | 按事件 | $0.0005 → $0.00025 | n/a | 同分类器,批处理模式 |
| Model Router | 按请求 | $0.005 | n/a | prompt 难度/歧义/领域分类器;~180 ms |
| Reserved B200 | 按 GPU 小时 | 联系销售 | 联系销售 | 为生产 agent 集群预留的专属算力 |
🔧 API 与开发者体验
- •接口风格: OpenAI 兼容 REST,base URL 为 https://api.morphllm.com/v1 —— 官方 OpenAI Python/TypeScript SDK 改 base_url 即可直接用。每个开源权重 chat 模型同样支持 Anthropic Messages 协议(/v1/messages 与 /v1/messages/count_tokens),所以 Anthropic SDK 与 Claude Code / Codex 不改一行就能跑。
- •端点: /v1/chat/completions(全部 chat 模型 + Fast Apply 通过 model=morph-v3-fast|auto)、/v1/messages(chat 模型的 Anthropic 格式)、/v1/messages/count_tokens、/v1/compact(原生 Morph Compact 格式)、/v1/responses(OpenAI Responses API 形式)、/v1/reflex/predict(Reflexes)、/v1/router/classify + /v1/router/multimodel(Model Router)、/v1/fine_tuning/*(自定义 Reflexes)、/v1/models(带价与上下文长度的模型列表)。
- •鉴权: Bearer token(单一 MORPH_API_KEY)用于所有端点;Anthropic 格式调用也接受 `x-api-key: KEY` header。API key 在 Morph 控制台 morphllm.com/dashboard/api-keys 创建,对所有产品(Apply、Compact、WarpGrep、Router、Fast Models、Custom Reflexes)通用。
- •Fast Apply 提示词格式: 专属 `<instruction>{简要描述}</instruction><code>{原始完整文件}</code><update>{部分修改片段,用 // ... existing code ... 标记未变部分}</update>` 模板。模型在 `choices[0].message.content`(或 Anthropic `content[-1].text`)返回完整合并后的文件。推荐用 `auto` 让 Morph 根据复杂度在 morph-v3-fast(10,500 tok/s, 96%)和 morph-v3-large(5,000 tok/s, 98%)间路由。
- •Compact 与 keepContext 标签: POST /v1/compact 接受 `{ input, query?, compression_ratio, preserve_recent }` 并返回 `{ output, compacted_line_ranges }` —— 调用方能清楚看到哪些行存活。用 `<keepContext>` 包裹的段落无论压缩比都 byte-for-byte 保留。同样可通过 /v1/chat/completions 的 `model: morph-compactor` 与 /v1/responses 调用。
- •WarpGrep 工具循环: morph-warp-grep-v2.1 会为 grep_search / read / list_directory / glob / finish 输出 `tool_calls`。开发者要在本地文件系统执行每个工具调用,并以 `{role: 'tool', tool_call_id, content}` 消息回复。通常 3-6 轮。模型负责路径解析与片段抽取,开发者负责实际 I/O。
- •MCP Server: `npx @morphllm/morphmcp@latest` 将 `edit_file`、`codebase_search`、`github_codebase_search` 暴露为 Claude Code / Cursor / Windsurf 的原生 MCP 工具。`claude mcp add morph -- npx -y @morphllm/morphmcp@latest` 注册;环境变量 MORPH_API_KEY 覆盖鉴权。
- •Claude Code & Codex 接入: 四个环境变量把 Claude Code 路由到 Morph:`ANTHROPIC_BASE_URL=https://api.morphllm.com`、`ANTHROPIC_AUTH_TOKEN=MORPH_API_KEY`、`ANTHROPIC_MODEL=morph-kimik3`、`ANTHROPIC_SMALL_FAST_MODEL=morph-kimik3-fast`。Sonnet/Opus/Haiku 通过 base URL 映射到 Morph 模型;File edits、Bash、Grep 工具仍走 Anthropic tool_use 循环。
- •Model Router: /v1/router/classify 返回 `{ difficulty, ambiguity, domain }` 标签(含 confidence 与 meets_threshold)。/v1/router/multimodel 接受 `allowed_models` / `allowed_providers` / `policy: balanced|cost_efficient` / `default_model`,返回单一最佳模型(例如 easy prompt + 0.93 confidence → claude-haiku-4-5-20251001)。
- •Service Tiers(GLM-5.2): OpenAI 的 `service_tier` 参数映射到 GLM-5.2:`default` / `auto` / 省略 = 标准处理;`standby` = 尽力而为容量、无 SLA,在车队利用率 >25% 时返回 429 与 `Retry-After`(未生成不收费)。重试退避或改用 `default` 跑交互流量。
- •SDK: 官方 TypeScript SDK `@morphllm/morphsdk`(npm)、官方 Python SDK `morphsdk`(pip)、MCP Server `npx @morphllm/morphmcp@latest`。Anthropic SDK 与 OpenAI SDK 通过 base_url 改动原生支持。Fast Apply / WarpGrep / Compact / Reflexes / Router 通过原生 HTTP 或 MorphClient 包装调用。
🧠 为 Agent 而生的推理
Morph 的定位是 agent loop,而不是聊天。一个编程 agent 把绝大多数 token 花在四件事上:搜仓库找正确代码片段、把修改应用回文件、压缩上下文让下一次 LLM 调用还能塞得下、把简单和复杂的 prompt 分别路由到能搞定的最便宜模型。Morph 为这四件事分别提供了专门的推理端点 —— WarpGrep 用内置工具做 6 秒内语义搜索,Fast Apply 跑 10,500 tok/s 并输出 byte-for-byte 合并后的文件,Compact 跑 33,000 tok/s 并以 `<keepContext>` 保证 byte 级保留,Model Router 在 ~180 ms 内分类 prompt 难度 —— 全部共用一个 API key 和一个 OpenAI 兼容 base URL。开源权重 chat 阵容(Kimi K3 2.8T、GLM-5.2 744B、Qwen 3.5 397B、DeepSeek V4 Flash、MiniMax M3/M2.7、Qwen 3.8/3.6 27B、Gemma 4 31B)同时支持 OpenAI 与 Anthropic 协议,让 Claude Code、Codex、Cursor 与任何 agent 只需四个环境变量就把 Anthropic 换成开源权重模型。Y Combinator 背书的 AutoInfra, Inc. 每天服务 100B+ token、覆盖 400+ 生产 agent,并在 OpenRouter 上排名 Top 25。
🌐 区域可用性与延迟
Morph 运营 https://api.morphllm.com 单一全球端点,无文档化的亚太或区域路由。北美与欧洲生产流量首字节延迟低至几十毫秒;中国大陆需代理或中转,跨太平洋首字节延迟通常 200-400 ms。OpenRouter 上发布的 Morph 模型(morph/morph-v3-fast、morph/morph-v3-large)走 OpenRouter 自己的多区域基础设施,这给中国开发者提供了 OpenRouter API key 内的低延迟 Fast Apply 路径 —— 但开源权重 chat 阵容(Kimi K3、GLM-5.2、Qwen 3.5 397B 等)只在 Morph 直连与 OpenAI/Anthropic 直连可用,不经过任何区域感知代理。截至 2026 年 8 月没有 ICP 备案的中国大陆端点。