数据公司闷声发财:成立不到一年估值25亿美金
去年还被认为估值飙升过快的AI应用明星公司,今年在数据公司面前已显得平常。一批成立不满一年的数据公司中,已诞生估值25亿美元的UniPat,以及多家估值3至8亿美元的公司。AI应用、硬件、具身、世界模型等领域的讨论热度有所消退,唯独数据公司一提就让人来劲。与以往创投明星不同,这批数据公司和创始人渴望低调,据说创始人之间达成默契:只PR技术实力,对团队和业务保密,对媒体主要诉求是“求别写”。
这行业来钱快,流传着二线数商月入400万美元、在校生月薪10万美元的造富故事。很多数商表示拿融资并非真需要钱,而是要基金名号吸引人才和客户,要VC提供庇护。这大概是一级市场最快速的估值增长记录:Kimi成立一年才到25亿美元,陈冕干了三年最近才快完成30亿美元估值融资。
数据公司常用“连接智能与现实”“加速AGI进程”等大词,但一句话可概括:给模型制作练习题,类似AI时代的猿辅导。预训练吃的是互联网公开静止数据,但真实工作场景中模型还达不到优秀打工人水平,需跟专家学或做练习。数商做的事就是找问题、想解法、搭环境:要么采集领域专家真人解题轨迹,要么给模型出包含任务、运行环境和评分准则的RL environment,交给模厂做单科专项训练。中国数商还有创新做法:发bench,基本可理解为对模厂的营销手段——你家孩子这门课考得不行,隔壁谁谁第一名,就是因为做了我们家练习题。
过去两年模型公司比算力和算法,今年这两件事边际收益下降。流水线建成后,剩下区别只在原料即数据,这几乎是模型此刻唯一重要的事。美国Scale AI和Surge AI也这么火起来。这是数据公司估值膨胀的原因之一。但如果只是数据,这些公司也不大可能值这么多钱。一些数据公司也在讲Neo Lab甚至可能的模型故事:有了足够多钱和足够好researcher、快速补上算法和算力,数商有没有可能成为新模厂?或至少成为模厂分封在某个垂直领域的诸侯?相比正被模型吞吃的应用,这个上限和下限似乎都高多了。几年时间、上百亿美元投入,在这个叙事中,模厂所有积累似乎都可被轻松跨越。
除去故事和技术神秘主义,数据其实更像野生野长的ToB生意,数商像各拼手艺的工作室,还没拉开明显差距。关系,尤其跟顶级模厂的关系,才是最核心关窍。这是信任市场,至今没有公认验收标准。因专业度高、数量太大,前期模厂基本只能靠抽检。比较靠谱的方法是后验:扔到模型里跑一轮看表现有没有提升。但也发生过一个数商把同一批数据交给两家模型公司,一家明显进步,另一家区别不大。所以模厂对数商信任是慢慢建立的,先从几十万人民币小单做起,靠谱再慢慢加。行业疯传的上亿美元大单其实都是年框合同,分批采购验收,不合格会被打回。
不过比起质量,模厂此刻更在意速度和数量。共识是:谁能拿到最多数据,谁就能占领更多垂直领域,对应垂直市场商业价值。宁可泥沙俱下,不可放过错过。所有人都在赶时间,一类数据往往不到三个月就过时;需求文档今天发下来,数商后天就要交货。甚至一些珍贵但此刻还不需要的数据,模厂也愿买走囤积,以防被对手占领。
这也是信息市场,实力硬不如消息灵。什么时候需要什么数据的判断,从金字塔顶端一层层向下传导:国内一线模厂跟着OpenAI和Anthropic走,二线模厂再跟着一线模厂走。数商能比别人更早更准获取这些信息,就相当于在股市里获得内部消息。比如GPT-6 Astra九月发布,但从六月起就有数商到处打听能搞到CAD图纸的门路——他们已从海外或国内顶级模厂知道消息,开始准备囤货。后来Astra爆火,建模数据果然变得昂贵。
这更是油水很足的市场。愿给数据预算的模厂里,第一梯队是字节,相传有十几亿美元;阿里、腾讯次之。焦虑落后的蚂蚁、小红书、美团、滴滴们也都有买行业数据需求。
我曾问一个数商朋友,做好数商最关键是什么?他毫不犹豫:当然是跟模厂搞好关系。听起来跟SaaS这种吃销售的行业很像。但他有个比喻:AGI是神,模厂researcher们是祭司,掌握圣经解释权,所以凡人要交什一税,换取他们多透露天机。这么说我就懂了,数商就是身披神圣祭袍的金牌销售。
围绕researcher的是很小圈子。模厂内部researcher基本来自北大、清华、港科、北航等定点高校,师兄弟姐妹互相提携。数商和模厂之间常常就是前同事、同门、同学。这也解释了为什么头部数商创始人多半出身模厂。这些看上去技术驱动的公司,founder却往往很有street smarts。江湖传闻中,有邀请众researcher看演唱会的;有陪模厂数据采购人游山玩水一个月的;有如Surge AI和Mercor请大量美女销售跟researcher打交道的。

信任当然不止酒肉朋友这么简单。一些没有顶级研究能力的数商之于模厂,理论上还可扮演另一个角色——体外自由分身,帮主体承担一些不能、也不便承担的风险。假设你是模型公司,想蒸馏OpenAI和Anthropic的模型,但合规和舆论风险都很大。这时有个安全方法:
更多推荐阅读

OpenAI太贵,美国大厂转投中国开源模型
企业AI正进入模型分流阶段,中国开放模型正在吃下美国企业的AI降本红利。OpenAI、Anthropic开始被客户嫌贵。不只是硅谷创业公司,AT&T这样的电信巨头也把约40%的AI工作负载放到开放模型上,并计划一年内提高到70%。AT&T每天处理450亿Token,在这一规模下,每百万Token便宜一点,反映到财务报表上都很可观。于是,一批原本主要调用OpenAI、Anthropic前沿模型的美国...
2026-10-02
卸载CC Switch,换上Magpie:统一模型入口更省心
已卸载 CC Switch,改用 Magpie。原因有两点:一是 CC Switch 功能越堆越多;二是它只能切换配置,而 Magpie 解决的是统一模型入口。 换上 Magpie 后没有使用交互难度。它向下兼容 CC Switch 的模型配置功能,同样可以配置 Claude Code、Codex、Gemini CLI,分别设置 API 地址、Key、模型,管理配置文件并快速切换。 Magpi...
2026-10-02
首发!openJiuwen WorkSwarm全双工多模态交互上线
AI助手正在进入一种新的工作节奏:一边对话,一边调用工具办事。近期Gemini Live更新将后台工具调用放入实时交互,助手可以先回应“我查一下”,再继续处理耗时工作。这带来一个问题:工具任务运行时,AI还能否继续接话? 理解此事需先理解“全双工”。传统语音助手像对讲机,用户说完AI才接话,AI说话时用户插话会被打断或忽略。全双工则像打电话,AI可边听边说,用户能随时打断、补充,对话不再严格按回...
2026-10-02
Anthropic营收狂飙12倍,1/4靠两大神秘客户
据路透社消息,招股书显示Anthropic约1/4营收来自两家神秘大客户,各占12%。2025年其营收飙升至原来的12倍,接近46亿美元,按此计算两家客户分别贡献约5.52亿美元,合计约11.04亿美元。这意味着任一家客户采购变化都会影响超十分之一年度收入,可能降低收入稳定性及议价能力。此前The Information报道称,Anthropic年化收入约40亿美元时,前两大客户合计贡献约12亿美...
2026-10-02
能斗舞的机器人7.9万起,银河星仔ET1价格公布
能跟人类舞者Battle的机器人来了。银河通用推出全自研物理世界原生智能体银河星仔ET1,专为人形机器人实时多模态交互和运动打造,共三个版本:基础版7.9万元,专业版13.9万元(搭载Nano 40TOPS),旗舰版17.9万元(搭载NX 100TOPS),起售价比外界预期的20万元低不少。 当前人形机器人市场存在明显价格鸿沟:消费级约2万—3万元,准专业级约8万—12万元,专业级约12万—20...
2026-10-02
平遥古城36小时AI短片黑客松,贾樟柯当评委
朋友圈里,有人新疆自驾,有人海岛躺平。而我,带薪杀到平遥古城,看一群创作者把自己塞进36小时倒计时,用AI现场拍短片。 LibTV联动抖音AI创作浪潮计划,发起「X小时之后」主题AI短片黑客松。规则简单粗暴:36小时,30+个队伍,自由组队,现场创作,最后交片。活动设置覆盖创意、叙事、视觉呈现等维度9大奖项,奖金3万元到20万元不等。贾樟柯亲自做评委,现场聊了他怎么看AI内容创作,以及AI会怎么...
2026-10-02