一篇arXiv上归类为cs.AI、cs.CL、cs.LG的论文,给出了一组可量化的实验结论:他们提出的PASS自适应SFT指令选择法,在4种不同主干模型+预算组合的测试场景里,连续超越7种当前最先进的指令选择方案;后续的消融实验进一步证实,它的自适应资源分配逻辑,比传统的均匀分配效果更稳定。
SFT是用预训练大模型适配下游任务的标准路径,但下游要学的概念,预训练阶段得到的支持度天差地别——高频概念练得扎实,低频概念就弱得可怜。这篇论文引入了“前置障”的概念,专门量化预训练模型对目标概念的支持,和竞争概念相比到底差多少。研究发现,前置障符合典型的长尾分布:头部概念的前置障低,SFT时只需要少量指令就能覆盖;尾部概念的前置障高,必须补额外的针对性指令才能学好。
PASS的解法核心,就是把有限的标注预算花在真正“需要补”的地方。它会先构建参考概念库,评估每条SFT指令能提供的区分性证据;再结合当前哪些概念的覆盖度还不够,把预算优先分配给这些缺口大的概念——同时兼顾“指令有没有用”和“哪里缺监督”,不是瞎凑数量,也不是只挑容易的。
对产业界来说,这算是解决了SFT里的一个真问题:很多垂直场景的下游任务,概念分布本身就是长尾的——比如医疗领域的罕见病症识别、电商的小众品类推荐,之前用均匀选指令的方式,大量预算砸在高频概念上,尾部概念却没怎么进步。PASS的思路,相当于把SFT的资源利用率提了一个层级,不用加更多数据或更大模型,单靠优化指令选择逻辑,就能拿到更扎实的效果。
这篇论文没有堆模型参数,也没炒概念,只是在SFT的指令选择环节做了一次精准的优化,实验数据也够硬。现在行业里聊大模型落地,总在喊要更大的参数、更多的算力,可这篇论文提醒大家:哪怕现有模型不变,把有限的标注资源用在刀刃上,带来的提升也不可忽视。那下次厂商做垂直领域的SFT训练时,会不会先算清楚自家任务的“前置障”分布,再调整预算分配?还是继续按老办法均匀砸钱呢?
素材来源:arXiv (LLM/多模态新论文) · AI情报、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧