2026年10月,AI创投圈冒出来个没名字的小动静:一个10人团队,没产品没名气,拿了五源资本、IDG的3000万美元融资,估值直接推到2亿美元。创始人是2024年闹得沸沸扬扬的“字节投毒实习生”——北大博士生田柯宇,当年他一边陷入字节索赔800万元的诉讼,一边拿了NeurIPS 2024最佳论文,这事儿到现在还在AI圈吵得没定论。
他的世界模型,要用AI自己的语言
田柯宇没跟李飞飞走同一条路。李飞飞的World Labs主打空间重构,要把2D还原成3D,再去琢磨物理规律,工程成本高,算力烧得狠。田柯宇绕开了显式三维重建,核心是搞一套AI专属的符号语言——人类看不懂,但AI能用它们压缩、预测视频。目前他的团队搭了20万个这样的符号,号称能把生成1秒视频的成本降至少一个数量级。
这个思路不是凭空来的。2024年他在字节实习时做的VAR论文,是第一篇来自中国大陆的NeurIPS最佳论文。当时视觉生成卷成两派:要么像LLM那样把图像拉成1D序列,注意力爆炸;要么是Midjourney、Sora用的扩散模型,画面好但算力慢,还和LLM架构不搭。田柯宇的VAR另辟蹊径,保留图像二维结构,用多尺度残差VQ-VAE从1×1到下一级逐层并行预测,生成速度直接翻20倍,还靠GPT架构搞定了多模态大一统的基础,跑通了近乎完美的Scaling Law。
现在他要把VAR的逻辑套到视频上,准备喂1亿小时视频,2027年推基座模型,重心暂时不着急商业化。
当年的“投毒”,不是网传的那样
网上传的“8000张GPU、千万损失”是夸大。事实是2024年6-7月,田柯宇在字节商业化部门实习做VAR,不满同事超额占算力,就用Hugging Face的安全漏洞,在权重文件里塞恶意代码,干扰同事训练——结果是他所在的30多人团队,一个季度的活白干。
字节一开始想内部处理,田柯宇后来还否认、报警,直到法院判他赔50万,退实习工资,公开道歉。2026年彭博专访里,他承认做错了,说当时是“以暴制暴”,如果重来会换更聪明的做法。
争议核心其实是大厂的算力内卷:AI团队排队等GPU,怎么分配资源,至今是大厂的难题。天才的技术能力和职业底线的冲突,资本该怎么选,从当年吵到现在。
资本押他,赌的是效率能降维打击
2026年世界模型是风口,融资消息满天飞:李飞飞的World Labs被AMD82亿收购,杨立昆的AMI拿10.3亿种子轮,林俊旸的语用科技拿2.2亿。流派也分了好几种,田柯宇的路线是纯自回归,效率优先。
五源他们看中的就是他的符号压缩:视频里的冗余太多,20万个符号相当于超级压缩包,只留核心动作,AI更容易抓物理因果,推理成本低。李飞飞的路线要重建三维,他的团队可能知道拱桥的样子,但不知道抽掉砖会塌——田柯宇不用建3D,靠自己的符号系统去学物理规则,这是另一种玩法。
但风险也摆在那:10人团队要处理1亿小时视频,20万个符号能不能在长时序里稳定?过往的争议会不会影响招人、找合作?资本会不会等不及?
这事儿到最后,其实是两个问题:技术上,纯自回归的世界模型,能不能真的比李飞飞的路线跑通?人性上,田柯宇能不能用技术突破,把当年的污点变成行业里的独特标记?
素材来源:雷峰网 · AI情报、融资并购、大模型、AI应用落地
查看报道原文

发表第一条评论吧