星光澄海 | BLOG

Perplexity发布新嵌入模型:9B版MADQA达92.4%

Perplexity刚推的pplx-embed-v2-late里,9B参数的版本,在MADQA(代理PDF问答任务)上拿了92.4%的准确率——这是目前公开嵌入模型里的高分之一,比同类的Mixedbread retriever还高3.5个百分点。

两个尺寸,适配不同场景

这次的模型分两款,0.6B和9B。0.6B总参数594M,活跃参数里340M分配给图像,剩下给文本,内存占1.2GB左右,笔记本甚至边缘设备都能跑。官方给的定位是“100%本地的查询编码器”,适合低延迟的本地查询。9B版总参数9B,内存要16-18GB(bf16精度),得用数据中心或高显存GPU,官方说它是用来做文档索引的。
有意思的点是:用0.6B模型去查9B的索引,文本任务能补上两款模型一半的质量差距,成本却只花0.6B模型的查询开销——相当于用边缘级的成本,吃到了接近大模型索引的质量。

跨模态共享嵌入空间是核心

它走的是ColBERT风格,不是把整个文档压缩成一个向量,而是每个token输出128维的向量,比竞争对手的2048-4096维窄16到32倍,这对减小体积很关键。更特别的是,文本、图像、渲染后的PDF页面,都能塞进同一个嵌入空间,不需要额外的OCR把图像转成文本,直接编码图像就行,跨模态搜索不用绕弯。
训练上是从18B的“教师模型”用LEAF风格蒸馏来的,这个训练方法让跨模态共享嵌入空间的效果落地了,不用分开训练文本和图像模型。

得分亮眼,也有明确短板

官方公布的基准分里,9B版MADQA的92.4%是目前最高的之一,只有Mixedbread的代理搜索93.4%比它高0.9个百分点。72个领域任务里,9B版的nDCG@10是81.3%,比其他测试模型高1.6个百分点。但也有硬伤:
ViDoRe v3 Markdown任务,0.6B版只拿了61.2%,是两款模型里最低的;图像搜索上,腾讯的EVIE比0.6B高,Gemini Embedding2比9B版还强;而且它有几个限制:单个输入不能混文本和图像,索引大小随文档长度增长(存每个token的向量,长文档会占更多空间),所有得分是自报的,技术报告还没公开。

这款模型用MIT授权,允许商用,Hugging Face上已经有权重,还能自己托管,官方计划后续上线托管API但目前还没上线。现在嵌入模型不再是单一文本,能跨模态,还能边缘查询加大索引的组合,确实给RAG场景带来了新的可能性。但索引大小的增长、跨模态输入的限制,还有得分没第三方验证的问题,也摆在那。
问题来了:这种边缘+大索引的跨模态嵌入方案,是会加速RAG的普及,还是会因为索引成本的问题,让中小团队用起来有门槛?


素材来源:MarkTechPost · AI情报、大模型、AI应用落地
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown