星光澄海 | BLOG

HRIL用高阶张量抓多模态协同:比现有方法强在哪?

多模态自监督学习已经在好多场景出成果了,但有个死穴:有些任务需要的信号,单看某一个模态根本找不到。比如一张图配一句“猫在追老鼠”,“追”这个动作的核心信号,得同时看猫的身体姿态和老鼠的位置,单拿图像或单独的文本都抓不全。这种“只有多模态联合配置才会出现、任何单模态都没法恢复的任务信号”,叫协同信息,之前的方法一直抓不住。这篇cs.AI和cs.LG分类的arXiv工作,HRIL,给出了解法。

原来的方法为啥抓不到协同?
之前的多模态表征学习,要么盯着各模态的共享信息,要么靠对比学习硬对齐模态的特征,本质上没区分“共享信息”和“协同信息”的不同——共享信息是单模态里也有的,协同信息却只能从多模态的组合里冒出来。说白了,之前的目标不对,自然抓不到需要的信号。

HRIL的核心:高阶张量的巧劲
HRIL的关键观察很实在:协同信息藏在模态间的高阶统计依赖里。所以它直接构建了模态嵌入上的“经验交叉矩张量”,用来表示多模态之间的多向交互。接着用塔克分解得到核心张量,还加了个“协同感知正则化”——这个正则化不是随便加的,是为了防止模型把“能量”(也就是学习到的有效信息)集中在局部,保住高阶耦合的能力,这样模型才能精准抓住只有多模态凑一起才有的协同信号。

实际效果:哪些任务受益最多?
实验结果是实打实地好:在受控协同任务和真实世界的基准任务上,HRIL都比现有多模态对比学习方法有稳定提升,尤其是那些靠协同信号驱动的任务,提升更明显。另外,HRIL的代码已经公开在GitHub上,地址是https://github.com/brightest66/HRIL,想试的可以去扒。

现在HRIL主要用在表征学习上,你觉得要是把这套高阶张量的思路用到多模态生成里,能解决图文生成里常见的“动作不连贯”这类问题吗?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、开源生态
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧

支持 Markdown