Perplexity AI (Perplexity AI)

收录于 https://docs.perplexity.ai

综合排名 #6 ⭐⭐ 推荐
❌ 需代理 | 🌍 国际

💰 Token 价格

类型 价格 备注
输入 (Input) Sonar Pro: $3/M, Sonar: $1/M 每百万 tokens
输出 (Output) Sonar Pro: $15/M, Sonar: $1/M 每百万 tokens
💡 免费额度

API 无免费额度,Pro 订阅 $20/月(5000次搜索查询)

🤖 支持模型(共 3 个)

Sonar Pro Sonar Perplexity Assistant

✨ 优势

  • Sonar Pro 内置联网搜索,回复附带引用来源
  • API 简洁易用,1:1 复制网页版体验
  • 速度快(Sonar 约 300ms 首 Token)
  • 搜索结果质量高(优于 GPT-4o online)
  • 支持自定义 search_domain_limit 参数

⚠️ 不足

  • × 不支持 Function Calling
  • × 模型不可选(无法指定底层模型)
  • × API 无免费额度,价格不低
  • × 国内需要代理才能访问
  • × 仅面向搜索场景,不适合通用对话

🎯 适合场景

搜索增强的问答应用;需要可靠引用来源的内容生成;研究辅助工具

💰 价格与方案

方案价格最佳用途限制
Sonar(按量计费)$1/M 输入 + $1/M 输出 + $5/1k 搜索查询轻量问答、低频搜索最便宜档;无月最低消费
Sonar Pro(按量计费)$3/M 输入 + $15/M 输出 + $5/1k 搜索查询Pro 级推理 + 多源引用联网检索推理,2× 上下文
Perplexity Pro 订阅$20/月(或 $200/年)终端用户网页/App、每天 500 次 Pro 搜索非 API 套餐 — 仅面向消费者
企业版(定制)协议价批量合同高频检索 + 私有语料库 RAGSLA + 自定义搜索域白名单
引用附加费每 1,000 次引用查询 $5(Sonar/Sonar Pro)搜索索引调用成本叠加在 token 价格之上

🔧 API 与开发者体验

  • API 风格: 兼容 OpenAI /chat/completions 端点,额外支持 search-domain 与 recency 参数;与 OpenAI 客户端 SDK 形状一致。
  • Base URL: https://api.perplexity.ai — 单一全球端点,无需区域选择。
  • SDK 兼容性: 只需覆盖 base_url 即可替换任何 OpenAI SDK;不需单独的 Perplexity SDK。官方 Node/Python 示例已在文档中提供。
  • 引用返回: 每次响应附带 `citations` 数组(含源 URL 与摘要文本)— 可直接传入 UI 渲染,无需自行抓取。
  • 搜索域过滤: `search_domain_filter`(域名白名单)与 `search_recency_filter`(小时/天/周/月)限制检索索引的查询 — 合规敏感场景有用。
  • 流式输出: SSE token 流;引用随最后一个 chunk 返回,不交错 — UI 需做缓冲或在完成后追加渲染。
  • 工具 / 函数调用: 截至 2026-08 不支持 — Perplexity 通过自有索引检索而非用户函数调用。变通:将工具定义写入 system prompt 头部。

🌐 引用溯源联网搜索

引用溯源联网搜索是 Perplexity 在 2026 年所有 LLM API 中最独树一帜的能力:每次 Sonar/Sonar Pro 响应都会返回一个结构化的 `citations` 数组,包含源 URL 与支撑每条论断的精确摘要 — 下游 UI 可直接渲染内联脚注、来源列表或悬浮卡片,无需任何额外抓取步骤。`search_domain_filter` 参数将检索器限制在域名白名单内(合规、新闻、金融场景特别有用),`search_recency_filter` 强制设定新鲜度窗口(小时 / 天 / 周 / 月)。引用费用按 $5 / 1,000 次单独计费,叠加在 token 价格之上 — 返回 5 条引用的 Sonar Pro 调用实际上同时支付推理与搜索索引访问两笔成本。相比自建检索管线的取舍很清晰:零基础设施维护、无爬虫滞后、无索引陈旧 — 但引用覆盖面取决于 Perplexity 索引抓取的内容,对实时事件的延迟约 5-30 分钟。

🌏 中国访问与延迟

Perplexity 的 API(api.perplexity.ai)无法从中国大陆直接访问 — 生成端点与引用查询都需要稳定的代理或 VPN。北京 / 上海 / 深圳开发者的常见变通方案有三:(1) 通过已为其他 LLM API 做代理的美国区域 VPS 转发;(2) 使用聚合器(OpenRouter、Portkey)— 它们部署 CN 边缘节点并替你签署上游合同;(3) 通过国际版 App Store 订阅消费者 Pro 套餐,不碰 API 即可镜像网页体验。非中国大陆区域延迟稳定 — Sonar 通常约 300 ms 返回首 token,因为引用查询与 LLM 预热并行触发。对于高频引用密集型负载(新闻监控、RAG),单次调用成本主要由 $5/1k 引用附加费主导,而非网络跳数;因此成本优化应优先考虑引用次数,其次才是延迟。