多模态大模型生成交错图文内容时,之前的方案普遍要靠额外数据训练,计算成本高,还常出现视觉主体丢失、时序混乱、物理逻辑不合理的问题。新提出的SCO方法不用额外训练,在挑战性基准测试中,时序一致性和视觉主体保留效果显著提升,还能扩展到视频生成,优化机器人操作等物理过程建模。
交错图文生成的老坑
之前做交错图文生成,比如一段图文交替的故事、带配图的说明,总会遇到各种bug。要么是生成的图跟文字对不上,写的是猫,出来的图是狗;要么是时序乱,说“先开门再拿快递”,图里反而先拿快递;更糟的是物理逻辑错,比如机器人抓东西的动作反了。这些问题,之前的解法基本是靠给模型加额外的增强数据再练一遍,不仅算钱花得多,效果还没解决根本问题——毕竟数据堆得再多,也难保所有细节都对。
SCO的巧劲:不用训练的校正
这次提的SCO,是个不用额外训练的方法。它把无分类器引导的更新当参考基准,加了两个互补的约束来做最小程度的调整,不用全量重训。第一个是新事件约束,盯着生成内容的时序,确保前后动作不矛盾;第二个是状态保留约束,全程扣住视觉主体,别中途换了模样或者丢了特征。这么一来,生成内容的稳定性就上来了,不用花大价钱堆数据。
不止图文:覆盖更多场景
实验测了挑战性交错多模态生成基准,SCO的效果确实顶,时序一致性和视觉主体保留都有明显提升。而且它的适配性还不错,能扩展到视频生成领域,甚至能优化物理层面的建模——像机器人操作的动作、长时序的手工制作过程,都更贴合现实逻辑。这就意味着,不止图文,其他需要连贯生成的多模态场景,也能用上这套方法。
不用额外训练的优化方法,会不会是解决生成类模型痛点的一个新突破口?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型
查看报道原文

发表第一条评论吧