Letta 有状态 Agent 2026 评测:Apache-2.0 记忆优先运行时与定价

Anthropic 在 2026-08-19 发布 Skills API + Files API + Computer Use 之后,关于 2026 年的「agent 平台应该长什么样」的争论分裂成了两个阵营:闭源厂商栈——记忆、技能、工具都藏在 API 后面;开源 agent runtime——把开发者与 agent 放在三者之上。Letta(法人实体 Letta, Inc.,注册地旧金山)正是后一阵营目前最有分量的开源尝试。主仓库 letta-ai/letta 持有 24,416 GitHub 星Apache-2.0 许可,最后提交 2026-08-23;CLI 端 @letta-ai/letta-code 在 npm 上周下载 64,176 次。本评测覆盖 Letta Agents SDK 究竟做什么、已验证的定价(Free $0、Pro $20/月、Teams Pro、Developer Plan、Enterprise)、持久化记忆模型、Skills + Mods + Channels,以及何时应该选 Letta 而不是闭源 agent 平台。

🌍 一句话结论: Letta 是一款开源、以记忆为先的 agent runtime——Apache-2.0 的 harness 把 agent 的持久化记忆掌控在手里,让 agent 在运行时改写自己的记忆文件,并提供 Skills API(可复用工作流)、Mods 层(harness 级自改进,2026-06)、Channels(Slack/Telegram/Discord 派发)。定价按套餐 + 用量:Free $0(3 个 agent、BYOK),Pro $20/月(20 个 agent、Letta Auto 额度 + 按量超额),Developer Plan(API key 按量、不限 agent 数),Enterprise(商务报价,支持自托管)。取舍点在于:Letta 是 agent runtime,不是模型 API——你得自带 LLM key(或走 Letta Auto)并单独付推理费用。无中国大陆直连端点。

Letta 究竟是什么

Letta 自我定位为「打造有状态 agent 的平台」。agent harness 完全开源(Apache-2.0),Letta Agents SDK 把同一个 agent 跑在三个表面上:桌面 App、CLI(@letta-ai/letta-code,需要 Node.js 22.19+)、platform.letta.com 上的 Cloud Agents。从文档与博客验证过的能力:

  • 持久化记忆是 agent 的责任。三块记忆结构——core(始终在上下文)、archival(长期可搜索)、recall(最近消息)——加上运行时记忆编辑工具,agent 可以改写自己的记忆文件,而不只是从一个向量库里查。
  • Skills APIdocs.letta.com/configuration/skills)把可复用工作流打包,供 agent 按需调用。这跟 Anthropic Skills API(2026-08-19)正面对位——两者都是「可复用 agent 工作流」,但 Letta 版本跑在你自带的任意模型上。
  • Mods(2026-06)直接扩展 Letta Code harness 自己,让 agent 在学习中重塑自己的工具栈。这叫「harness 级适配」,跟普通插件不是一回事。
  • Channelsdocs.letta.com/configuration/channels)把 AI 同事送进 Slack、Telegram 或 Discord,配合 always-on 云 VM 部署(platform/computers/byom),让 agent 在手机上也能触达。
  • Conversations API(2026-01)在并发体验间维持共享记忆——多个用户可以跟同一个 agent 协作而不丢上下文。
  • BYOK 全程支持。所有套餐都支持自带 API key(OpenAI、Anthropic、Google、Kimi、Z.AI)。CLI 中的 /connect 让用量从你的供应商账户走账——不消耗 Letta 信用。

Letta 的主张是一篇立场宣言:「为什么记忆不是插件」(2026-04 博客)。记忆不能被简单「外挂」成一个向量库或一次 RAG 调用。上下文与状态管理是 agent harness 自己的核心责任。Apache-2.0 许可保护的就是这一点:如果你不满意 Letta 对记忆的建模方式,你可以 fork 整个 harness 跑自己的版本。

已验证定价(letta.com/pricing,2026-08-25)

Letta 按套餐 + 用量计费。没有按 token 的模型价,因为模型是 BYOK(或在 Pro 套餐及以上走 Letta Auto 按量付费)。下表所有费率均来自定价页实时抓取。

方案价格适合场景亮点
Free$0 / 月BYOK 试用 Letta3 个有状态 agent、Letta Auto 用量有限;自带 ChatGPT/Codex、Kimi、Z.AI 等 API key
Pro$20 / 月个人日常跑 agent最多 20 个 agent、Letta Auto 周/月额度、按量超额、图像生成额度
Teams Pro按席位需要共享 agent 工作流的组织Pro 全部功能 + 团队共享 agent、权限控制、agent 间通信
Developer Plan按量(凭 API key)生产环境构建在 Letta API 上的团队不限 agent 数量、纯按量信用计费、可编程用量仪表盘
Enterprise商务报价自托管或大规模部署定制模型、更高限额、自托管选项、专属支持

定价页 FAQ 明确:服务端 Letta API 工具按 CPU 时间 $0.00015/秒计费;远程 MCP 工具由 MCP 供应商执行(不计 Letta 信用);Letta 内置工具除 web 搜索/抓取外均免费。所有套餐的 BYOK 用量都走你自己的供应商账户,缓存与限速策略继承 OpenAI/Anthropic/Google 合同,而非 Letta。定价页本身提醒重度用户向上规划:casual coding user 大约 $100/月用量,power user 经常超过 $200/月。

持久化记忆模型详解

现代 agent 框架里的大多数「记忆」功能,本质上是披着检索外衣的向量库:把过去上下文做嵌入,让 agent 拉相关片段。Letta 的模型根本不同:agent 拥有三块显式的记忆块,并且能用记忆工具在运行时编辑它们——不只能查,还能写。

  • core memory——始终在上下文的块。可以理解为 agent 的持久自我描述:我是谁、在做什么项目、用户的关键事实。事实变化时,agent 会更新这个块。
  • archival memory——长期可搜索存储,存放 agent 不需要每轮都看到但应该记住的事实。插入通过工具调用,agent 自己决定什么值得记。
  • recall memory——最近消息检索,时间窗口最短。用来查用户几轮前说过什么,不必重读整个对话。

跟「纯向量库」设计的实际差异:上周学到你的仓库构建命令的 Letta 编码 agent,会把这些命令写进 core 并永久带下去,不用你每会话重讲一遍。学到你会议节奏的 Letta 个人助手会把「周一/三/五 10:00 站会」写进 archival memory,并在相关时把它带出来。curator 是 agent,不是开发者。

在 Skills + Computer Use 这一刻的位置

2026-08-19 Anthropic 发布 Skills API + Files API + Computer Use,把可复用工作流与桌面控制搬上了同一厂商栈。Letta 是这条栈的开源答案,关键差异在于:每一层 Letta 都是独立的。

能力Anthropic(闭源)Letta(开源)备注
可复用工作流Skills APISkills API同一思路,Letta 版本模型无关
记忆 / 状态闭源 harnesscore / archival / recall 块Letta 上 agent 可运行时改写记忆
桌面 / 浏览器控制Computer Use(GA)自带 MCP 即可MCP 工具在 MCP 供应商侧运行
派发面API + Claude.ai桌面、CLI、Cloud Agents、Channels(Slack/Telegram/Discord)Channels 含 always-on 云 VM
模型选择仅 Claude任意(BYOK OpenAI/Anthropic/Google/Kimi/Z.AI)Letta Auto 路由器为默认
自托管不支持支持(Apache-2.0)Enterprise 自托管 + 定制模型

两条栈组合得很好。一个 Letta agent 可以用 Claude 做推理(BYOK),把调用包成一个 Skill,把 Skill 注册到 Mods 让 agent 学到何时使用它,再通过 Channel 交付结果——全程记忆跨会话保留。组合是 opt-in 而非厂商锁定,Apache-2.0 许可保证 runtime 本身不会被收回。

Mods(2026-06):agent 重塑自己的 harness

Mods 是 Letta 最具主张的特性。Skills 是 agent 调用的可复用工作流,Mods 则扩展Letta Code harness 自己。这意味着 agent 可以改写自己怎么跑——加工具、换行为、调整 prompt 结构——随学习而变。2026-06 发布帖把它定位为「让 Letta Code harness 扩展与适配的 agent 友好方式」。

这一区分对风险建模很关键。Skills 给 agent 的工具箱加新动作;Mods 改引擎本身。生产里,这两者的差异是「agent 现在能跑一种新查询」与「agent 重写了自己决策逻辑的一部分」。Letta 的框架假设后者是特性:agent 之所以越用越好,是因为它适配了自己的 substrate。开源许可在这里保护开发者:Mods 出问题时,agent 与 harness 都可读可审计。与闭源 agent 平台相比,闭源栈连 harness 本身都是不透明的。

Channels 与 always-on AI 同事

Channels 把 Letta agent 变成你能从聊天客户端戳的东西。Channels 文档把 Slack、Telegram、Discord 都列为「一等公民」派发面。每个 Channel 把 agent 接入一个具体聊天平台;agent 在后台运行,被点到时回答。

要让 AI 同事从手机上触达,harness 必须常驻运行。Letta 的 always-on 云 VM 部署(在 platform/computers/byom)让 agent 跨重启存活。Pro 及以上套餐包含远程沙箱;Enterprise 套餐进一步支持定制区域与自托管选项。

限制与坑

  1. 是 agent runtime,不是模型 API。Letta 不提供自己的 LLM。你得自带 API key(BYOK)或通过 Pro 套餐的 Letta Auto 路由器为推理付费。如果只要模型 API,Letta 是错的一层——从 OpenAI、Anthropic、DeepSeek 或某专用提供商开始。
  2. 无中国大陆直连端点。Letta, Inc. 是美国实体,platform.letta.com 是单一全球端点。从中国大陆的生产流量需要代理或中转(典型跨太平洋首字节延迟 150-250ms)。Apache-2.0 许可意味着自托管是 China 驻留的正解。
  3. 重度用户很快超过 Pro 套餐。定价页自己估算 power user 总用量 $200+/月。请按列表价预算,而不是 $20/月入门价。
  4. 服务端工具按 CPU 时间计费。服务端 Letta API 工具成本 $0.00015/秒 CPU。长跑工具调用(重型 MCP、长 bash)让单次任务成本不可忽略。CLI 中的客户端工具免费,因为跑在你自己的机器上。
  5. Free 档上限 3 个 agent。如果你在评估真实生产工作负载,Free 很快用尽。Pro($20/月)才是任何严肃个人使用的实际门槛。
  6. Agent 框架语义有学习曲线。词汇(core / archival / recall、Mods、Skills、Channels、byom)全是新的。正式投入前请花一两天读文档、跑 quickstart。

FAQ

Letta 是向量数据库吗?不是——Letta 是带有「一等公民持久化记忆」的 agent runtime。archival 记忆块是可搜索的,但它是 agent 自己的记忆层,不是通用向量库。要专门的向量库方案,看 WeaviatePineconeQdrant 评测。

我能自托管整套 Letta 吗?可以。letta-ai/letta 仓库是 Apache-2.0;桌面 App、CLI、Agents SDK 都可以跑在你自己的基础设施上。Enterprise 套餐在自托管之上支持定制区域与专属支持。

Letta 开箱支持哪些模型?BYOK 覆盖 OpenAI、Anthropic、Google、Kimi、Z.AI。Letta Auto 选项为 Pro 及以上加自动前沿模型路由(带 Auto Chat 与 Auto Fast 变体)。任何其他 OpenAI 兼容端点可通过 SDK 添加。

Letta 跟 Mem0 或类似记忆层怎么比?Mem0 专注记忆层本身(抽取、存储用户事实)。Letta 的记忆更广——它包含 core / archival / recall 块、运行时编辑,以及围绕它们的完整 agent harness。要整个 agent,选 Letta;只要能塞进你自己 agent 的记忆层,选 Mem0。

Letta 就是老 MemGPT 项目吗?Letta 由 UC Berkeley 的 MemGPT 研究团队创立。Letta, Inc. 商业实体把研究产品化,做成了 Letta Agents SDK 与 Cloud Agents 产品;研究血脉延续到他们的 研究出版物中。

结论

Letta 是 2026 年最强的开源、以记忆为先的 agent runtime,也正好是 Skills + Computer Use 这一刻 agent harness 半边的天然候选。Anthropic 在闭源、Claude 专属栈上做 Skills API + Files API + Computer Use;Letta 在 Apache-2.0、模型无关的运行时上做同一概念层(Skills、Mods、Channels)。定价透明、按套餐划分:Free $0(3 agent、BYOK),Pro $20/月(20 agent、Letta Auto 额度 + 超额),Developer Plan(API key 按量、无 agent 上限),Enterprise(自托管、定制模型)。取舍的形状恰好:Letta 不想做模型 API,所以你可以把它与你按成本/质量选的模型提供商组合,Apache-2.0 许可保护 runtime 本身免受厂商撤退。如果你在构建有状态 AI 同事或编码 agent,又想要跨会话记忆而不放弃模型选择,Letta 就是答案。权威资料源:Letta 定价页文档letta-ai/letta 仓库。

如果你想把 Letta(或 Claude、GPT、DeepSeek、Qwen)装在一个 OpenAI 兼容的 API key 后面,并且为 agent 技术栈做跨区 failover,FreeModel 是最简单的对接:单一仪表盘、单一账单关系、无需胶水代码的路由控制。