Perplexity开源两款Embedding模型:0.6B边缘版和9B高质量版,MADQA得分92.4%,MIT许可可自托管。
Perplexity 发布了 pplx-embed-v2-late,这是一对 ColBERT 风格的多模态嵌入模型。有两种规格:0.6B 用于快速、低成本查询,9B 用于追求最高质量。两个模型都能检索文本、图片和渲染后的 PDF 页面,且共享同一个嵌入空间。
能否部署?可以,如果你自己托管的话。两个模型均已上架 Hugging Face,采用 MIT 许可证。Perplexity 计划提供托管 API 端点,但目前尚未上线。
0.6B 模型处理图片时使用约 340M 活跃参数,性能接近 8B 级别的竞品。
可以用 0.6B 模型查询去检索 9B 索引,在文本任务上以 0.6B 的查询成本恢复约一半的 9B 质量差距。
其 128 维 token 向量比 2,048 到 4,096 维的竞品窄 16 到 32 倍。
采用 MIT 许可证,允许商业使用。
每个 token 存储 1 个向量,因此索引大小随文档长度增长。
在 ViDoRe v3 图像检索上并非第一,腾讯的 EVIE 得分更高。
单个输入无法混合文本和图片。
所有分数均为自测报告,技术报告尚未发布。
| 指标 | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| 总参数量 | 594M | 9B(Hugging Face 标注为 8B) |
| 活跃参数 | 文本约 240M,图片 340M | 7.4B |
| 基座模型 | Qwen3.5-0.8B,裁剪至 12 个文本层 | Qwen3.5 |
| 输出 | 每个 token 128 维 | 每个 token 128 维 |
| 内存权重(bf16,估算) | 约 1.2 GB | 约 16 到 18 GB |
| 目标机器 | 笔记本、边缘设备或小型 GPU | 数据中心或高显存 GPU |
| Perplexity 建议角色 | 实时查询编码器,100% 本地运行 | 构建文档索引 |
Perplexity 将 0.6B 模型设计为可在边缘设备上运行的轻量级查询编码器。两个模型卡均展示了 CUDA GPU 使用方式。需要 sentence-transformers >= 6.0.0 和 transformers >= 5.4.0。内存数据为每参数 2 字节的估算值,仅含权重。发布的 checkpoint 以 F32 格式存储,下载大小翻倍。
以下所有数据均来自 Perplexity 公告:
| 基准 | 0.6B | 9B | 排名 |
|---|---|---|---|
| MADQA(Agentic PDF 问答,准确率) | 90.1% | 92.4%(最佳) | 击败 Mixedbread retriever(88.9%),落后于 Mixedbread Agentic Search(93.4%) |
| 领域文本(72 项任务,nDCG@10) | 78.0% | 81.3% | 9B 领先所有测试模型 1.6pp;0.6B 落后 gemini-embedding-2 仅 0.3pp |
| Q2D-Web(Recall@1000) | 73.6% | 74.8% | 两者均超越此前最佳成绩 69.3% |
| ViDoRe v3 图像(nDCG@10) | 62.3% | 65.2% | 0.6B 与 nemotron-colembed-v2-8b 仅差 1.2pp;EVIE 领先 |
| ViDoRe v3 Markdown(nDCG@10) | 61.2%(最弱) | 64.7% | 两者均击败所有外部测试模型 |
| BrowseComp+(准确率) | 未给出 | 64.0%(最低) | 仍比下一名 ColBERT 模型高 4.9pp |
最强成绩:9B 模型在 MADQA 上达到 92.4%。最大领先幅度在 BrowseComp+,比最佳 dense 模型高出 8.7 个百分点。
最弱成绩:0.6B 模型在 ViDoRe v3 Markdown 上仅 61.2%。但这仍是该基准的第二高分。图像搜索是真正的短板:Gemini Embedding 2 在 MIRACL-Vision 上击败了 9B 模型,在 PPLX-Q2I 上领先 2pp。
混合规格:用 0.6B 模型查询 9B 索引,在 ViDoRe v3 图像检索上得 63.5%,以相同查询成本击败了双端 0.6B 的 62.3%。
Dense 模型将文档压缩成 1 个向量,而 pplx-embed-v2-late 为每个 token 保留一个 128 维向量。它用 MaxSim 打分:每个查询 token 找到最佳文档 token,再将各最大值求和。页面被编码为图片,因此无需 OCR 步骤。Perplexity 用 LEAF 风格的 token 级训练从一个 18B 教师模型蒸馏出两个模型,正是这种训练创造了共享空间。
最佳适用场景:PDF、幻灯片和扫描报告的视觉文档搜索。
低延迟搜索:用 9B 在云端建索引,然后用 0.6B 在设备上查询。
大规模 PDF 或网络语料集的 Agentic RAG。
| 特性 | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| 规格 | 0.6B、9B | 约 8.8B | 0.8B、2B 开放版本 | 未公开 |
| 向量宽度 | 每个 token 128 维 | 每个 token 4,096 维 | 每个 token 2,048 维(小模型) | 128 到 3,072 维,1 个向量 |
| 输入 | 文本、图片、页面渲染 | 文本查询、页面图片 | 文本、页面图片 | 文本、图片、视频、音频、PDF |
| 运行平台 | 自己的 GPU;0.6B 可上边缘设备 | NVIDIA A100/H100,Linux | CUDA GPU(Ampere+) | Google API |
| 跨规格共享空间 | 是 | 未说明 | 未说明 | 不适用 |
| 许可证 | MIT | CC-BY-NC-4.0 | Apache 2.0(小模型) | 专有 |
0.6B 模型适配边缘设备;9B 模型为索引构建时的质量而生。
最佳成绩:MADQA 上 92.4%。最弱成绩:ViDoRe v3 Markdown 上 61.2%。
用 0.6B 查询 9B 索引,胜过双端 0.6B。
存储增长和自测分数是主要注意事项。
请前往 Hugging Face 查看模型权重和技术详情。所有荣誉归该项目的研究人员。也可以关注我们的 Twitter,加入 15 万+人的 ML SubReddit,订阅我们的Newsletter。还有 Telegram 群也可以加入。
【赞助】Web 是大多数 Agent 缺失的那个 API。数据库、日历、代码仓库都有 API,而开放的 Web 基本上没有。TinyFish MCP 服务器为任何 MCP 客户端提供四个工具:TinySearch、TinyFetch(将完整页面转为 markdown,包含 JavaScript)、TinyBrowser(用于登录和表单)、TinyAgent(用于多步骤任务)。Search 和 Fetch 免费使用。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了人工智能媒体平台 Marktechpost,该平台专注于机器学习和深度学习新闻的深度报道,既技术严谨又通俗易懂。该平台月浏览量超过 200 万次,显示出其在受众中的受欢迎程度。