一觉醒来20个PR自动合入主干,SpaceX工程师五个月交付3000+
同时跑20多个智能体,上个月交付1000多个PR,8月目标翻倍。这位GrokBot工程师拉出GitHub贡献曲线:五个月,3000多个PR。提PR、跑验证、合进主干,整个链条智能体自己跑完,中间不用她过手。用她的话说:一觉醒来,20个PR已经躺在主干分支上了,而且翻了一遍,写得还不错。
她也知道这话听着让人怀疑代码质量,紧跟着补了一句:这么说显得我像个批量制造垃圾代码的人,我保证我不是。
她的做法是同时跑20多个GrokBot,装在她自己开源的pstack里,配合/loop、/goal和/swarm,让智能体完整地拥有一个任务,自己干,自己验,自己交。

这位工程师叫Lauren Tan,前Cursor工程师,待过Meta和Netflix,在Netflix当过两年工程经理,现在负责SpaceXAI的GrokBot。
AI写代码已经不稀奇,真正让人好奇的是一个人一个月提交1000多个PR,而且没把代码库变成一堆垃圾。
一年前,几乎没什么人用智能体写代码。那时候的模式是你时刻盯着一个智能体,每一行输出都要看。这一切没办法并行,因为你不信它。每个用过智能体的人都尝过信任崩塌的滋味。有一次她报了个bug,智能体一口咬定是这儿的问题,她翻开工具调用记录一看,它压根没读那段本该相关的代码。几次之后她想明白一件事:智能体在猜,而且它不知道自己在猜。

Lauren在Netflix当过两年工程经理,发现管人的技巧和管智能体的技巧重合度惊人。五个月前她刚入职Cursor,第一个月产出很低。五个月后,她把自己从曲线最左端挪到了10到20这一格。
她干的第一件事是给智能体造一双眼睛。她认为重要的技能不是提示词,而是验证:让智能体真的能把代码跑起来,能抓CPU耗时记录,能抓内存快照,能自己打开iOS模拟器点一遍。没有这一层,瓶颈就是你自己。
她写的第一批技能之一叫control glass,教智能体自己去调Chrome DevTools协议,自己跑起应用,自己截图、点击、读控制台。配套的feature map把每个功能从用户视角怎么进入、快捷键是什么、选元素该用哪个属性都列好。

然后是Benny,她做的自动化智能体,在Slack里专门接bug报告。它跑到云端开一台自己的电脑,在里面运行Cursor,用同一套control glass技能操作应用,试着把问题复现出来。有一次它这样回话:在修复前的提交上复现出来了,修复后消失。附上一条云端运行记录的链接。它给的不是一句「应该已经修好了」,而是一组能对照的证据。
她验证技能本身好不好用的做法有点狠:派出一堆子智能体跑评测,给它们的目录起一些看不出来的名字,不让它们知道自己正在被评估。再叫一个不同模型家族的智能体当裁判,交叉复核,防止自评偏袒。
Lauren敢撒手,靠的不是模型变强,是让护栏变硬。GrokBot的架构有个内部代号叫Dune。在Dune里,useEffect被禁了,用了CI直接报红。代码注释也被禁了,理由是她观察下来99%的情况智能体写的注释都在描述一些跟代码无关的历史片段。进程隔离方面,Dune直接分出electron main和electron renderer两个目录,CI检查依赖图,跨目录乱引用直接失败。

她的分层模型:最硬的一层是代码库架构本身,然后是CI、lint规则和编译器诊断,最软的是rules、skills和代码审查机器人。她的原话是:如果你只有规则、机器人、技能和一份代码风格指南,你的代码库变成一堆垃圾只是时间问题。
支撑整套架构的核心哲学只有一句:最短的路,就是最好的路。智能体解决问题时永远挑最省事的方式,那就把最省事的方式做成最正确的方式。
这笔账她刚算过:把GrokBot重构到这套架构,用掉了600多个PR。GrokBot当初是氛围编程堆出来的原型,速度极快,没人读代码,架构野蛮生长到失控。

她还常开一个玩笑:在AI的垃圾代码之前,先有人类的垃圾代码。在Meta,几万工程师共用一个巨型仓库,代码质量其实没那么好。但大厂那套照着「最不熟练的工程师」设计的框架、约定、凭据限制,恰好就是智能体需要的护栏。过去被嫌弃官僚的东西,现在成了资产。
她给出一条判断标准:当你在代码评审里靠打字告诉别人「这里不能这么写」的时候,这件事本身就是code smell。正确的动作是问自己:怎么把它变成一条lint规则?变成一次CI失败?或者干脆让这个问题从根上不可能发生?
Lauren用「主厨」来形容自己的定位:不再自己炒每一道菜,你的活儿变成了设计厨房,安排工位,分派任务。现在GrokBot团队里,产品经理和设计师会直接提交代码。一个从没写过前端的人,代码能进主干,靠的不是他突然会写了,是那套严格到烦人的架构约束替他兜住了底。
所以这背后不是程序员要失业了,是他们的位置在上移。被机器接走的,是干活、跟进度、跑测试、盯PR这些事,人的角色移到了定目标、划权限、设验收标准的位置上。程序员留在牌桌上的筹码,从「我会写代码」变成了「我能判断怎样写代码才算对了」。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05