星光澄海 | BLOG

LLM的小世界连接:对应推理性能的结构密码?

用六款LLM做剪枝实验,小世界结构完好的模型,推理性能掉得更少——arXiv cs.AI分类的这篇研究,把LLM的内部结构和推理能力直接挂上了钩。

为什么不看“表现”,要看“内部结构”?

之前评估LLM,不管是论文里的报告还是实际用的感受,基本都看“行为结果”:答逻辑题对不对,生成文本流畅度,或者WikiText测试集的困惑度。但这次研究的起点很直接:要真正搞懂LLM的推理能力,得绕开表面行为,看内部怎么工作。灵感来自神经科学的发现:人类大脑功能网络里,智力越高的个体,小世界连接越强。研究人员把这套逻辑套到LLM上,从注意力头的激活相似性构建功能连接图,专门找“小世界连接”这个结构特征和推理性能的关联。

小世界指数:推理能力的“硬结构签名”

小世界指数(SWI)衡量两个关键指标:本地聚类程度(比如注意力头是不是扎堆协作),全局路径长度(扎堆的头能不能快速连通其他集群)。结果很明确:不管是不同模型,还是同一模型的不同训练checkpoint,SWI越高,流体推理性能就越好。进一步挖重要注意力头的连接模式:对模型性能关键的头,更多和自己社区内的头相连(核心分数高),跨社区连接的权重又更集中(桥分数低)。研究因此假设:高核心分数+低桥分数,就是推理能力的结构信号。

SWA剪枝:比对手多保20%性能

要验证这个假设,最直接的是用剪枝——精简模型参数的常规操作,核心是选对要砍的部分。研究搞了个叫Small-World Allocation(SWA)的分层剪枝方法,完全用核心分数和桥分数指导剪枝的稀疏度分配。结果在六款LLM上,SWA的表现远超其他剪枝策略:不仅更好保留了小世界结构,模型性能掉得更少,WikiText困惑度最多降了20%。

这项研究给LLM推理性能提供了结构层面的可测量指标,补了之前只看行为评估的短板。但有个问题没说透:这个小世界结构,是推理能力的底层支撑,还是当前训练范式下的偶然结果?当模型规模再翻几倍,它会不会消失?还是会变得更重要?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown