Perplexity 的新上下文嵌入模型在文档检索中占据领先地位
核心要点
- pplx-embed-v2-context-9b-preview 在一次传递中对整个文档进行编码,建立在 v1 系列的基础上,该系列已经在 ConTEB 基准测试中击败了竞争对手 Perplexity AI 有一个新的上下文嵌入模型 pplx-embed-v2-context-9b-preview,

pplx-embed-v2-context-9b-preview 在一次传递中对整个文档进行编码,建立在 v1 系列的基础上,该系列已经在 ConTEB 基准测试中击败了竞争对手
Perplexity AI 有一个新的上下文嵌入模型 pplx-embed-v2-context-9b-preview,该公司表示它为文档检索设定了新的最先进技术。
这个技巧描述起来很简单,但实现起来却很难。该模型对整个文档进行一次编码,因此其中的每个部分都包含整体的上下文。
新模型实际上做了什么
问题在于分块。长文档在嵌入之前会被切成更小的片段,而这些片段通常会失去情节。
如果模型忘记了该文件是关于哪家公司的,那么“公司提高了预测”的内容就毫无用处。传统方法将每个块单独嵌入,就像阅读从小说中撕下的一页一样。
Perplexity 的上下文方法试图解决这个问题。通过一次性处理完整文档,该模型让每个块继承周围文本的信息。
该模型带有“预览”标签,这表明它是早期版本而不是成品。 Perplexity 将其定位为第一代上下文模型之后的下一步。
必须清除的 v1 基准栏
2026年2月26日,该公司发布了两个嵌入系列:pplx-embed-v1和pplx-embed-context-v1。
两者都有 0.6B 和 4B 参数大小。
在 ConTEB 基准测试中,pplx-embed-context-v1-4B 的平均 nDCG@10 为 81.96%。 nDCG@10 会对最相关的结果是否出现在前 10 名中,以及最好的结果是否位于顶部附近而不是第 9 名进行评分。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
作为比较,voyage-context-3 在同一指标上得分为 79.45%。 Anthropic 的模型得分为 72.4%。
Perplexity 还报告称,在内部网络规模基准测试中,Qwen3 嵌入的召回率大幅提高。这些测试分析了超过 10 亿个生产页面,尽管它们是由 Perplexity 本身而不是独立方运行的。
Perplexity 是如何构建它的,以及它的成本是多少
v1 训练过程从基于扩散的技术开始,涉及约 2500 亿个多语言标记。
之后,该公司采用了多阶段对比学习方法。该设置可以实现双向注意力,这意味着模型可以同时查看单词两侧的文本。
这些模型支持 32K 令牌的上下文窗口。
这些模型支持原生 INT8 和二进制量化。 Perplexity 表示,这可节省高达 32 倍的存储空间。
这些模型也不需要指令前缀。
v1 系列的 API 定价从每百万代币 0.004 美元到 0.05 美元不等,具体取决于变体和大小。
为什么 Perplexity 要建造自己的管道
Perplexity 最为人所知的是一种人工智能驱动的答案引擎。构建自己的嵌入模型使公司能够直接控制检索,并将内部基础设施转变为可以出售给外部开发人员的东西。
这些开发人员主要致力于语义搜索和检索增强生成(RAG)。 RAG 是一种首先获取相关文档,然后将它们交给语言模型的技术,这样它就可以根据证据而不是记忆来回答。
这对开发商和竞争对手意味着什么
对于开发人员来说,实际问题是成本、存储和切换工作。量化和缺乏指令前缀降低了操作负担,而定价范围使实验保持便宜。
有一些警告值得关注。一些最引人注目的比较(例如 Qwen3 召回率提升)来自 Perplexity 的内部基准测试,并且预览模型可能会在任何全面发布之前发生变化。
