星光澄海 | BLOG

Google推出AI视频副导演:用四个框架解决长视频AI连贯痛点

Google刚放出来的AI视频副导演,在自建的GenAD-Bench基准上拿了81.4分,比随机搜索基线的75.7高了一截——这不是最炸的,最有意思的是,之前大多数长视频AI,撑不过1分钟就会崩。

长视频AI的死穴:拍着拍着人都变样了

之前做AI长视频,最大的问题是语义漂移和级联错误。比如生成一个博物馆抢劫的故事,AutoStudio的版本里,贼的帽子会突然消失;Gemini-3.1-Pro的版本里,宝石的样子会变来变去,观众根本没法入戏。Google团队把这归为“信用分配问题”:视频崩了,你都不知道是哪一步的提示词出了错,没法针对性修改。

这套系统的核心不是替换现有生成模型,而是套在Gemini和Veo外面的编排层,模型本身还能兼容其他生成器,输出自带SynthID水印——相当于给AI视频打了“版权标签”,避免乱传。

四个框架,把零散片段串成10分钟的连贯故事

四个代理框架各管一块,刚好覆盖从规划到优化的全流程:
第一个是Co-Director,用多臂老虎机做创意规划,选叙事模式、审美原型,再生成分镜,最后用多模态大模型给片段打分,反向调整优化方向,它的成果还在COLM 2026上发表了。
第二个是CANVAS,管持久视觉记忆,能记住角色、场景、道具的状态,刚才说的博物馆例子,它能把帽子和宝石的样子稳住,背景连贯度提了21.6%,角色一致性提9.6%。
第三个是A²RD,训练-free的分段生成,循环“检索-合成-优化-更新”,能生成1到10分钟的视频,一致性比之前高30%,叙事连贯性提20%,Google还真出了10分钟的完整demo。
第四个是VQQA,用视觉问题反馈优化提示词,不用碰模型内部细节,选最优输出时不看最后一次结果,而是从所有迭代里挑,在T2V-CompBench和VBench2两个基准上分别提了11.57%和8.43%。

对开发者来说,这是不用训模型的新路子

对比同行,ByteDance的StoryMem要微调模型,Show Lab的MovieAgent要做LoRA适配,Google这个副导演不用动现有模型的训练参数,只是做了一层“协作调度层”,降低了接入门槛。现在它已经开源了Co-Director和A²RD的代码,CANVAS的代码还在开发中,不用等Google出成品工具,开发者已经能自己玩一部分。

Google把长视频AI从“凑好看的帧”变成了“全局优化世界状态”,这是个明显的转向。现在它能把零散的片段串成连贯的10分钟故事,但最终的创意内核还是得人定。你觉得,以后导演的辅助工作,会先被这种AI副导演吃掉吗?还是说,长视频的核心,终究还是人的故事本身?


素材来源:MarkTechPost · AI情报、大模型、AI智能体、AI应用落地
查看报道原文

发表第一条评论吧

支持 Markdown