Perplexity 构建定制服务基础设施,使人工智能搜索更快、更便宜
核心要点
- 这家人工智能搜索公司的新嵌入模型和服务引擎解决了每月运行数亿次查询的经济问题。
- ROSE 和自定义网络 更雄心勃勃的基础设施是 Perplexity 所说的 ROSE,是运行时优化服务引擎的缩写。
- Perplexity 通过自定义 RDMA 网络优化解决 MoE 服务问题,带宽效率高达 97.1%。

这家人工智能搜索公司的新嵌入模型和服务引擎解决了每月运行数亿次查询的经济问题。
运行每月处理大约 4 亿次查询的人工智能搜索引擎成本高昂。 Perplexity AI 一直在悄悄地构建基础设施,以减少这种情况,并发布了关于定制服务技术的研究,该技术涵盖从紧凑的嵌入模型到能够处理万亿参数模型的专有引擎等各个方面。
嵌入游戏
Perplexity 检索改进的核心是 pplx-embed 系列模型,其中包括 pplx-embed-v1 和 pplx-embed-context-v1。它们有两种大小:6 亿参数变体和更大的 40 亿参数版本。两者均于 2026 年 2 月发布。
Perplexity 声称,通过量化技术,可以在本质上降低模型权重的数值精度而不破坏准确性,从而将存储需求减少高达 32 倍。这两种模型都专门针对低存储部署进行了优化,这种设计选择反映了网络规模检索的实际情况。
ROSE 和自定义网络
更雄心勃勃的基础设施是 Perplexity 所说的 ROSE,是运行时优化服务引擎的缩写。 ROSE 于 2025 年 2 月左右推出,旨在服务于广泛的模型架构,包括日益流行的专家混合 (MoE) 格式,该格式为当今许多最大的语言模型提供支持。
Perplexity 通过自定义 RDMA 网络优化解决 MoE 服务问题,带宽效率高达 97.1%。 RDMA(即远程直接内存访问)让 GPU 无需通过 CPU 即可进行通信。该引擎跨 AWS Elastic Fabric Adapter 环境运行。 2025 年 11 月,Perplexity 在 arXiv 上发表了第一篇论文,详细介绍了这些优化,并开源了一个名为 Fabric-lib 的库,其中包含自定义 MoE 内核,该内核可提供该公司所描述的万亿参数模型服务的最先进延迟。
混合推理和设备端推送
2026 年 6 月,Perplexity 推出了混合本地云推理编排器。系统根据查询的复杂性,自动在本地硬件上运行的设备上模型和更强大的基于云的模型之间路由任务。 Perplexity 的编排器支持多个本地芯片选项,并将某些查询保留在设备上意味着它们永远不会访问服务器。
这对于推理军备竞赛意味着什么
该公司在 NVIDIA 基础设施上运行,并与 NVIDIA 和 CoreWeave 建立了战略合作伙伴关系,CoreWeave 是 GPU 云提供商,已成为 AI 工作负载的首选。在每月 4 亿次查询中,ROSE 的带宽效率高达 97.1%,并且量化嵌入带来的 32 倍存储减少直接转化为基础设施成本节省。
