何恺明团队刚放了个新东西——多模态模型的视觉原生Harness。
我没看到更多细节,但光这几个词,懂行的人已经能品出点不一样的味儿。
拆解这个名字的核心
多模态模型,就是同时处理文本、图像、视频这类不同类型数据的AI模型,现在已经是AI圈的主流方向之一。但这次的关键是「视觉原生」——不是把视觉模块随便塞进多模态框架里凑数,而是从视觉本身的底层逻辑出发做的东西。Harness在AI圈里指配套的工具链、开发环境,说白了就是给开发者搭好的一套脚手架,用来简化模型的部署、适配、调优这些麻烦活儿。
为什么是何恺明团队做这个
何恺明在计算机视觉领域的分量不用多说,他之前搞的MAE等模型,把自监督视觉学习推到了新高度,是行业绕不开的硬货。之前大家总觉得他的重心全在纯视觉模型上,没想到他的团队已经开始往多模态的工具层延伸了。
之前做过多模态开发的都懂,多模态最头疼的就是不同模态的适配——比如怎么把图像的视觉特征和文本的语义特征对齐,很多时候都是开发者自己凑出来的,不是从原生逻辑里长出来的。这个Harness既然敢标「视觉原生」,大概率就是冲着解决这个适配痛点来的,至少名字是这么暗示的。
对多模态开发的影响
现在市面上的多模态工具,大多是从通用大模型框架里改出来的,视觉部分只是加了个插件,没有自己的根。很多创业公司拼出来的多模态模型,性能全看开发者的手艺,没有统一的标准,稳定性也差。
这个视觉原生Harness如果真的按名字说的那样,从视觉原生逻辑出发做适配,那它能把开发者从繁琐的模态对接里解放出来,门槛会降不少,做出来的多模态模型性能也会更稳。
你觉得这个视觉原生的工具链,会成为接下来多模态开发的标配吗?
素材来源:量子位 · AI情报、大模型
查看报道原文

发表第一条评论吧