Morph (Morph)

收录于 https://morphllm.com

综合排名 #41 ⭐ 可考虑
❌ 无中国大陆直连端点。base URL https://api.morphllm.com 为单一全球端点,Y Combinator 背书的美国总部(AutoInfra, Inc.);OpenRouter 上 morph/morph-v3-fast 和 morph/morph-v3-large 走多区域路由,但官方端点不在大陆。中国大陆生产流量需代理或中转,跨太平洋首字节延迟通常 200-400 ms。 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) 按模型分别计费,按每 1M 输入 token 计(文本模型)。从 llms.txt 验证(2026-08-28):Kimi K3 $2.90、Qwen 3.5 397B $0.50、GLM-5.2 744B $1.10、GLM-5.3-Flash $0.15、MiniMax M3 $0.30、MiniMax M2.7 $0.279、DeepSeek V4 Flash (beta) $0.12、Qwen 3.8/3.6 27B $0.289、Gemma 4 31B $0.14。Qwen 3.5 397B 缓存输入 $0.30 per 1M(其他模型无独立缓存价)。Fast Apply 用 `auto` 模型按 prompt+completion 两档计(OpenRouter 验证 morph-v3-fast $0.0008/$0.0012 per 1k、morph-v3-large $0.0009/$0.0019 per 1k),Compact、Reflexes、WarpGrep 与 Router 按事件计费(详见 pricingEN)。 每百万 tokens
输出 (Output) 按模型分别计费,按每 1M 输出 token 计(文本模型)。从 llms.txt 验证:Kimi K3 $14.00、Qwen 3.5 397B $3.50、GLM-5.2 744B $4.10、GLM-5.3-Flash $0.50、MiniMax M3 $1.20、MiniMax M2.7 $1.20、DeepSeek V4 Flash (beta) $0.278、Qwen 3.8/3.6 27B $2.40、Gemma 4 31B $0.40。Fast Apply 输出按 morph-v3-fast $1.20 / morph-v3-large $1.90 per 1M token;Fast Apply 用 `auto` 推荐档(5,000-10,500 tok/s, ~98% 精度)按实际路由模型分档计费。Kimi K3 `service_tier: standby` 走 GLM-5.2 同等待遇,标准按 token 计。 每百万 tokens
缓存读取 Qwen 3.5 397B 缓存输入折扣价 $0.30 per 1M(折扣 40%);其他开放权重模型无独立缓存价(llms.txt: 'the other models have no separate cache rate')。Fast Apply / Compact / Reflexes / WarpGrep / Router 按事件或按 token 计费,无缓存档。 享折扣
💡 免费额度

无永久免费档(无零元 starter plan)。新用户注册即可获得 API key 并按 pay-as-you-go 充值;官方为初创公司提供 Startup Credits(最高 $5,000),但需单独联系销售申请。Morph 主页明确「Start free. Get API Key」,但实际计费从首次 token 调用开始。

🤖 支持模型(共 13 个)

Kimi K3 (2.8T MoE) — flagship Fable-tier open-weight model at ~100 tok/s with 1M context; per-1M input/output token pricing (verified on docs.morphllm.com llms.txt Fast Models table 2026-08-28) GLM-5.2 (744B MoE) — Opus-tier open-weight model with 1M context; OpenAI `service_tier` parameter supported for default/standby processing Qwen 3.5 397B — open-weight dense model at ~180 tok/s with 262k context; cached input bills at $0.30 per 1M GLM-5.3-Flash — fast 1M-context tier priced for high-volume agent workloads DeepSeek V4 Flash (beta) — 1M-context model with sub-second first-token Qwen 3.8 27B / Qwen 3.6 27B — dense low-latency models tuned for coding agents at ~100 tok/s with 131k context MiniMax M3 428B / MiniMax M2.7 230B — 256k/196k context MoE for agentic workflows at ~90 tok/s Gemma 4 31B — open-weight dense at ~120 tok/s with 175k context Fast Apply (morph-v3-fast 10,500+ tok/s / morph-v3-large 5,000+ tok/s) — specialized code-merge model with 96-98% accuracy on edits Compact (morph-compactor) — verbatim context compression at 33,000 tok/s; 100k tokens compresses in under 2 seconds WarpGrep (morph-warp-grep-v2.1) — semantic code search subagent with built-in tools (grep_search, read, list_directory, glob, finish) Reflexes (jailbreak, guardrail, leaked-thinking, stuck-in-a-loop, user-frustrated, etc.) — text classifiers running at ~90 ms per label Model Router — classifies prompt difficulty/ambiguity/domain in ~180 ms; $0.005 per request

✨ 优势

  • 推理专为 Agent 设计:Fast Apply / Compact / WarpGrep / Reflexes / Model Router 五件套端到端覆盖 agent loop(edit → search → compress → monitor → route)
  • OpenAI + Anthropic 双协议:一个 API key 同时跑 OpenAI Chat Completions 与 Anthropic Messages(含 Claude Code 与 Codex 集成)
  • Open-weight 旗舰模型阵容:Kimi K3 (2.8T) + GLM-5.2 (744B MoE) + Qwen 3.5 397B + DeepSeek V4 Flash + MiniMax M3/M2.7 + Gemma 4 + Qwen 3.8/3.6
  • Fast Apply 速度:morph-v3-fast 10,500 tok/s, 96% 精度;morph-v3-large 5,000 tok/s, 98% 精度;`auto` 档智能路由
  • Compact 33,000 tok/s 上下文压缩:100k token < 2 秒,保留 `<keepContext>` 标签内容 byte-for-byte 一致
  • WarpGrep 语义代码搜索 subagent:~6 秒/查询,自带 grep_search / read / list_directory / glob / finish 工具
  • Reflexes 11 个内置分类器(jailbreak / guardrail / leaked-thinking / stuck-in-a-loop / ambiguity / difficulty 等),~90 ms 内出标签
  • Claude Code / Codex / Cursor 一键接入:MCP server `npx @morphllm/morphmcp@latest` 暴露 edit_file / codebase_search / github_codebase_search 工具
  • Y Combinator 背书:Y Combinator logo + 'Backed by Y Combinator' 出现在 morphllm.com 页脚;OpenRouter Top 25 provider;100B+ tokens/day、400+ 生产 agent

⚠️ 不足

  • × 无大陆端点:API base URL https://api.morphllm.com 单端点无大陆/亚太区域,中国生产流量延迟 200-400 ms
  • × 无月度订阅 / 无永久免费档:纯 pay-as-you-go + Startup Credits(≤$5K)单独申请;评估周期需自垫
  • × 定价主要面向 agent 高频调用:旗舰 Kimi K3 2.8T $2.90/$14.00 per 1M,远高于通用 chat 模型价格档
  • × Fast Apply 必须使用专属 prompt 模板 `<instruction>{...}</instruction><code>{...}</code><update>{...}</update>` 才能拿到合并结果,不是 drop-in 的 OpenAI 替换
  • × WarpGrep 需本地工具执行循环:API 返回 tool_calls,开发者需在自己的文件系统上 grep / read / list / glob 然后回传(3-6 轮对话)
  • × GLM-5.2 `service_tier: standby` 在利用率 >25% 时直接 429,不保证 SLA;不适合延迟敏感的交互流量
  • × Compact / WarpGrep / Reflexes / Router 是 OpenAI 格式独占:不支持 Anthropic Messages 协议(仅文本模型双协议)
  • × 公司 2026 才 浮出水面(YC 阶段,AutoInfra, Inc.):社区生态、第三方 SDK、教程都比 OpenAI / Anthropic / DeepSeek 薄
  • × 无 affiliate 合作计划:无合作伙伴收入分成(cf. Cloudflare / OpenRouter)

🎯 适合场景

构建生产级 coding agent / 长期运行 agent 的团队,需要 Fast Apply (10,500 tok/s 代码合并) + Compact (33,000 tok/s 上下文压缩) + WarpGrep (~6s 代码搜索) + Reflexes (jailbreak / stuck-in-loop 监控) + Model Router 一站式的开发者;想要 Claude Code / Codex / Cursor 通过 MCP 接入并切换到 Kimi K3 / GLM-5.2 / Qwen 3.5 397B 开源权重模型的团队;需要 Anthropic 协议接入的开源权重推理场景;评估预算可通过 Startup Credits (≤$5K) 申请的初创公司。

💰 价格与方案

产品 / 模型计费单位输入输出备注
Kimi K3 2.8T (morph-kimik3)按 1M token$2.90$14.00旗舰 Fable 档;1M 上下文;~100 tok/s
Kimi K3 Fast (morph-kimik3-fast)按 1M token$6.00$22.50最快 Kimi K3 档;同 1M 上下文
Qwen 3.5 397B (morph-qwen35-397b)按 1M token$0.50(缓存 $0.30)$3.50262k 上下文;~180 tok/s;缓存输入 40% 折扣
GLM-5.2 744B (morph-glm52-744b)按 1M token$1.10$4.101M 上下文;~80 tok/s;支持 service_tier standby
GLM-5.3-Flash (morph-glm53flash)按 1M token$0.15$0.501M 上下文;高量 agent 预算档
MiniMax M3 428B (morph-minimax3-428b)按 1M token$0.30$1.20256k 上下文;~90 tok/s MoE
MiniMax M2.7 230B (morph-minimax27-230b)按 1M token$0.279$1.20196k 上下文;~90 tok/s MoE
DeepSeek V4 Flash beta (morph-dsv4flash)按 1M token$0.12$0.2781M 上下文;~150 tok/s;亚秒级首 token
Qwen 3.8 / 3.6 27B按 1M token$0.289$2.40131k 上下文;~100 tok/s dense
Gemma 4 31B (morph-gemma4-31b)按 1M token$0.14$0.40175k 上下文;~120 tok/s dense
Fast Apply (morph-v3-fast)按 1k token(OpenRouter)$0.0008$0.001210,500 tok/s;96% 编辑精度;推荐 `auto`
Fast Apply (morph-v3-large)按 1k token(OpenRouter)$0.0009$0.00195,000 tok/s;98% 编辑精度
Compact (morph-compactor)按事件 / 按 tokenn/an/a33,000 tok/s;100k token < 2s;<keepContext> 标签内容 byte-for-byte 保留
WarpGrep (morph-warp-grep-v2.1)按请求n/an/a每查询 ~6s;内置 grep/read/list/glob/finish 工具
Reflexes(实时)按事件$0.001 → $0.0005n/a11 个内置分类器;~90 ms 出标签;1M 事件分级折扣
Reflexes(异步批)按事件$0.0005 → $0.00025n/a同分类器,批处理模式
Model Router按请求$0.005n/aprompt 难度/歧义/领域分类器;~180 ms
Reserved B200按 GPU 小时联系销售联系销售为生产 agent 集群预留的专属算力

🔧 API 与开发者体验

  • 接口风格: OpenAI 兼容 REST,base URL 为 https://api.morphllm.com/v1 —— 官方 OpenAI Python/TypeScript SDK 改 base_url 即可直接用。每个开源权重 chat 模型同样支持 Anthropic Messages 协议(/v1/messages 与 /v1/messages/count_tokens),所以 Anthropic SDK 与 Claude Code / Codex 不改一行就能跑。
  • 端点: /v1/chat/completions(全部 chat 模型 + Fast Apply 通过 model=morph-v3-fast|auto)、/v1/messages(chat 模型的 Anthropic 格式)、/v1/messages/count_tokens、/v1/compact(原生 Morph Compact 格式)、/v1/responses(OpenAI Responses API 形式)、/v1/reflex/predict(Reflexes)、/v1/router/classify + /v1/router/multimodel(Model Router)、/v1/fine_tuning/*(自定义 Reflexes)、/v1/models(带价与上下文长度的模型列表)。
  • 鉴权: Bearer token(单一 MORPH_API_KEY)用于所有端点;Anthropic 格式调用也接受 `x-api-key: KEY` header。API key 在 Morph 控制台 morphllm.com/dashboard/api-keys 创建,对所有产品(Apply、Compact、WarpGrep、Router、Fast Models、Custom Reflexes)通用。
  • Fast Apply 提示词格式: 专属 `<instruction>{简要描述}</instruction><code>{原始完整文件}</code><update>{部分修改片段,用 // ... existing code ... 标记未变部分}</update>` 模板。模型在 `choices[0].message.content`(或 Anthropic `content[-1].text`)返回完整合并后的文件。推荐用 `auto` 让 Morph 根据复杂度在 morph-v3-fast(10,500 tok/s, 96%)和 morph-v3-large(5,000 tok/s, 98%)间路由。
  • Compact 与 keepContext 标签: POST /v1/compact 接受 `{ input, query?, compression_ratio, preserve_recent }` 并返回 `{ output, compacted_line_ranges }` —— 调用方能清楚看到哪些行存活。用 `<keepContext>` 包裹的段落无论压缩比都 byte-for-byte 保留。同样可通过 /v1/chat/completions 的 `model: morph-compactor` 与 /v1/responses 调用。
  • WarpGrep 工具循环: morph-warp-grep-v2.1 会为 grep_search / read / list_directory / glob / finish 输出 `tool_calls`。开发者要在本地文件系统执行每个工具调用,并以 `{role: 'tool', tool_call_id, content}` 消息回复。通常 3-6 轮。模型负责路径解析与片段抽取,开发者负责实际 I/O。
  • MCP Server: `npx @morphllm/morphmcp@latest` 将 `edit_file`、`codebase_search`、`github_codebase_search` 暴露为 Claude Code / Cursor / Windsurf 的原生 MCP 工具。`claude mcp add morph -- npx -y @morphllm/morphmcp@latest` 注册;环境变量 MORPH_API_KEY 覆盖鉴权。
  • Claude Code & Codex 接入: 四个环境变量把 Claude Code 路由到 Morph:`ANTHROPIC_BASE_URL=https://api.morphllm.com`、`ANTHROPIC_AUTH_TOKEN=MORPH_API_KEY`、`ANTHROPIC_MODEL=morph-kimik3`、`ANTHROPIC_SMALL_FAST_MODEL=morph-kimik3-fast`。Sonnet/Opus/Haiku 通过 base URL 映射到 Morph 模型;File edits、Bash、Grep 工具仍走 Anthropic tool_use 循环。
  • Model Router: /v1/router/classify 返回 `{ difficulty, ambiguity, domain }` 标签(含 confidence 与 meets_threshold)。/v1/router/multimodel 接受 `allowed_models` / `allowed_providers` / `policy: balanced|cost_efficient` / `default_model`,返回单一最佳模型(例如 easy prompt + 0.93 confidence → claude-haiku-4-5-20251001)。
  • Service Tiers(GLM-5.2): OpenAI 的 `service_tier` 参数映射到 GLM-5.2:`default` / `auto` / 省略 = 标准处理;`standby` = 尽力而为容量、无 SLA,在车队利用率 >25% 时返回 429 与 `Retry-After`(未生成不收费)。重试退避或改用 `default` 跑交互流量。
  • SDK: 官方 TypeScript SDK `@morphllm/morphsdk`(npm)、官方 Python SDK `morphsdk`(pip)、MCP Server `npx @morphllm/morphmcp@latest`。Anthropic SDK 与 OpenAI SDK 通过 base_url 改动原生支持。Fast Apply / WarpGrep / Compact / Reflexes / Router 通过原生 HTTP 或 MorphClient 包装调用。

🧠 为 Agent 而生的推理

Morph 的定位是 agent loop,而不是聊天。一个编程 agent 把绝大多数 token 花在四件事上:搜仓库找正确代码片段、把修改应用回文件、压缩上下文让下一次 LLM 调用还能塞得下、把简单和复杂的 prompt 分别路由到能搞定的最便宜模型。Morph 为这四件事分别提供了专门的推理端点 —— WarpGrep 用内置工具做 6 秒内语义搜索,Fast Apply 跑 10,500 tok/s 并输出 byte-for-byte 合并后的文件,Compact 跑 33,000 tok/s 并以 `<keepContext>` 保证 byte 级保留,Model Router 在 ~180 ms 内分类 prompt 难度 —— 全部共用一个 API key 和一个 OpenAI 兼容 base URL。开源权重 chat 阵容(Kimi K3 2.8T、GLM-5.2 744B、Qwen 3.5 397B、DeepSeek V4 Flash、MiniMax M3/M2.7、Qwen 3.8/3.6 27B、Gemma 4 31B)同时支持 OpenAI 与 Anthropic 协议,让 Claude Code、Codex、Cursor 与任何 agent 只需四个环境变量就把 Anthropic 换成开源权重模型。Y Combinator 背书的 AutoInfra, Inc. 每天服务 100B+ token、覆盖 400+ 生产 agent,并在 OpenRouter 上排名 Top 25。

🌐 区域可用性与延迟

Morph 运营 https://api.morphllm.com 单一全球端点,无文档化的亚太或区域路由。北美与欧洲生产流量首字节延迟低至几十毫秒;中国大陆需代理或中转,跨太平洋首字节延迟通常 200-400 ms。OpenRouter 上发布的 Morph 模型(morph/morph-v3-fast、morph/morph-v3-large)走 OpenRouter 自己的多区域基础设施,这给中国开发者提供了 OpenRouter API key 内的低延迟 Fast Apply 路径 —— 但开源权重 chat 阵容(Kimi K3、GLM-5.2、Qwen 3.5 397B 等)只在 Morph 直连与 OpenAI/Anthropic 直连可用,不经过任何区域感知代理。截至 2026 年 8 月没有 ICP 备案的中国大陆端点。