字节投毒实习生再创业,估值2亿美元挑战李飞飞

字节投毒实习生再创业,估值2亿美元挑战李飞飞

AI 资讯 来源:新闻/公众号 发布时间:2026-10-09 更新于 2026-10-09 预计阅读 5 分钟

2026年10月,AI创投圈出现一笔戏剧性融资:一家10人规模、无产品无名字的神秘实验室,获五源资本和IDG暗中投资3000万美元,估值达2亿美元。创始人正是2024年震动国内AI圈的“字节投毒实习生”、北大博士生田柯宇。他曾身陷字节跳动索赔800万元诉讼,同时以第一作者身份获NeurIPS 2024最佳论文奖。如今他要在世界模型赛道与李飞飞竞争。

当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型

田柯宇的切入角度独特:让AI发明自己的语言重新理解现实世界。他认为人类语言信息维度太低,无法完整描述物理世界。团队已搭建含20万个符号的“视觉词典”,人类看不懂,但AI可用其表示、压缩和预测视频,能将生成一秒视频的成本降低至少一个数量级。他们计划喂入约1亿小时视频,打造机器人、自动驾驶和交互式视频等领域的基座模型,计划2027年发布。团队暂不急于商业化。

当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型

该想法并非凭空诞生。两年前,他以第一作者身份拿下NeurIPS 2024最佳论文,论文题为《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》,是他在字节参与的项目,开发新一代视觉生成模型VAR。该论文从上万篇投稿中脱颖而出,关键在于让视觉生成像LLM一样依靠Scaling Law持续提升能力,同时降低生成成本和复杂度。

当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型

此前视觉生成有两条路线:一是模仿LLM的自回归路线,采用光栅扫描将2D图像展平为1D序列,导致二维空间联系被切割,注意力计算量爆炸;二是以Midjourney、Sora为代表的扩散模型,画面质量高但生成速度慢、算力消耗大,且与LLM架构不统一。田柯宇团队回到自回归路线,提出“下一尺度预测”:保留图像二维结构,通过多尺度残差VQ-VAE,从1×1模糊轮廓开始,逐层并行预测细节。该思路使生成速度提升20倍,用纯正GPT架构实现高质量视觉生成,并首次在视觉生成中跑通近乎完美的Scaling Law,模型参数从3亿扩至23亿时性能提升,还涌现出零样本图像修复、画面外扩和指令编辑能力。

然而,论文获奖同时,田柯宇争议爆发。2024年6月至7月,他在字节商业化技术部门实习期间,因不满算力分配,利用Hugging Face加载模型存档的安全漏洞,在权重文件中植入恶意代码,干扰同事模型训练,导致团队30多位研究者一个季度白干。2024年8月,字节解除其实习协议,同步北京大学等机构。10月,聊天截图扩散,字节澄清“8000多卡、损失千万美元”严重夸大。田柯宇多次否认并报警,字节于11月25日起诉索赔800万元。12月4日,NeurIPS公布其论文获最佳论文奖,系首篇来自中国大陆的NIPS最佳论文。法院最终判决田柯宇违反实习合同,赔偿字节50万元并返还全部实习工资。

2026年彭博社专访中,田柯宇承认自己做错了,“当时我的做法无异于以暴制暴”,表示若重来会采取更明智做法。此事折射出大厂AI实验室算力内卷的组织困境,也引发创投界唯人品论与唯技术论的争议。一方面有投资人称“人品有问题的绝对不能投”,另一方面世界模型赛道顶尖人才极度稀缺,田柯宇在视觉自回归、模型压缩上的工程能力正是赛道刚需。其融资透露新风向:资本开始押注效率。

2026年世界模型融资不断:李飞飞World Labs累计融资超10亿美元,估值54亿美元,被AMD 82亿美元收购;杨立昆AMI Labs种子轮10.3亿美元,估值45.3亿美元;林俊旸语用科技首轮2.2亿美元,估值20亿美元。世界模型作为连接机器人、自动驾驶、具身智能体、交互式虚拟场景的底层物理引擎,正加速分化出像素渲染派、几何物理模拟派等流派。

标签: AI 资讯 AI

更多推荐阅读

0.2秒急停!因果智能让机器人真懂物理世界

0.2秒急停!因果智能让机器人真懂物理世界

这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间。当金属易拉罐被混在蛋糕盘里端向微波炉,机械臂会先挑出易拉罐,确认安全后再将盘子送入炉内。即便用手电筒闪机器人的“眼睛”,它依然置若罔闻。这些画面不是动作回放,也不是碰巧猜对,而是系统基于对物理世界因果规律的理解,实时推理出的一连串动作。驱动这套机器人的系统代号为CRIS-0,背后是UCSD助理教授、CMU因果学派学者黄碧薇创立的因...

2026-10-09
字节发现DeepSeek时强时弱原因:输入位置每隔4个Token就变

字节发现DeepSeek时强时弱原因:输入位置每隔4个Token就变

字节Seed团队发现,DeepSeek-V4存在一种“神鬼二象性”:同一道题、同样的内容,仅在前面加入几个无关字符,模型答案就会在正确与错误之间反复横跳,且以4个Token为周期规律性变化。 研究人员最初用DeepSeek-V4官方推理代码中的FP8量化函数做补全测试。正确答案应为8,但模型有时会答成32。他们在代码前加入由等号组成的装饰性文档字符串,仅调整等号数量,代码、补全位置和答案均不变,...

2026-10-09
OpenAI解雇三名安全研究员,联名公开信曝内幕

OpenAI解雇三名安全研究员,联名公开信曝内幕

上周,OpenAI解雇三名员工,称其违反敏感信息访问与处理规定,涉嫌在既定程序外向第三方AI安全评估组织分享机密信息。三人分别是从事模型对齐研究的Jasmine Wang、参与OpenAI与外部安全评估机构技术沟通的Tomek Korbak,以及从事AI安全及模型对齐研究的Mikita Balesni。 三人随后在社媒发表致OpenAI领导层的公开信。Mikita Balesni称,被解雇是因为...

2026-10-09
苹果10月13日发布会剧透:你家将成最大AI终端

苹果10月13日发布会剧透:你家将成最大AI终端

过去十几年,苹果把越来越多设备放进用户的口袋、背包和手腕,却始终没能在客厅找到稳固位置。如今,一封写着「Welcome home」的邀请函,宣告苹果准备重新争取这个位置。苹果已官宣将于当地时间 10 月 13 日在纽约举行新品发布活动,预计推出配备屏幕的家庭中枢、新一代 HomePod mini,以及更新后的 Apple TV 4K。贯穿三款设备的核心,是屡次跳票的新一代 Siri AI。邀请函上...

2026-10-09
谢扬推出Qoni:给Agent发一张工牌

谢扬推出Qoni:给Agent发一张工牌

谢扬认为,Personal Agent 的终点不该是更聪明的命令行。他做的 PA infra 于国庆节后上线。同一天,ChatGPT 上线交互 UI,图形化 Personal Agent 路线之争正式开始;谢扬的 Qoni 也上线,定位为给 Agent 发工牌的基建系统。 当前 Agent 没有身份,也没有公认鉴权方法。用户只能把身份、账户信息开放给 Agent,让它假冒自己办事。类似问题互联网...

2026-10-09
谷歌Gemini 4 Argon突袭:已对部分用户开放

谷歌Gemini 4 Argon突袭:已对部分用户开放

海外科技圈爆料,谷歌下一代模型 Gemini 4 Argon 已密集现身多个平台,并对部分 Pro 用户开放。它已登录 Google Cloud,在编程工具 Antigravity 中被设为默认模型,甚至开始在代码库直接提交代码。科技媒体 TestingCatalog 和 Benzinga 跟进证实,内部系统已上线相关发布卡片。种种迹象显示,Gemini 4 Argon 最快本周甚至数小时内突袭发...

2026-10-09
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部