300行代码就能重建Cursor?AI编程工具会员还香吗
你如果不能在几个小时内重建 Cursor,下次面试会非常艰难——那不过是300行代码的一个while循环。Ralph Loop创造者Geoffrey Huntley把软件工程师的底线划在300行。看似离谱,但大家发现,他可能是对的。

过去一年,Claude Code、Codex、Antigravity等大厂产品底层路径越来越相似:Agent Loop读写上下文、调用工具、反复执行,用测试和权限兜底。上下文、工具、Loop、记忆和多Agent,逐渐成为一套公开的标准牌面。

大厂之外,个人Harness项目也在疯狂涌现。如今拥有庞大社区的Pi和Aider,也都是从个人项目起步。面向DeepSeek优化的Reasonix,则由游戏引擎开发者YHH个人发起,迅速发展成数万Star的社区项目。DeepSeek宣布招募Harness内测后,评论区变成“个人Harness展销会”,数百个开源仓库覆盖Coding Agent、记忆、Skills、评测和安全等方向。

当模型可以替换、Harness可以复刻、常见组件趋同,Coding Agent还能靠什么打出差距?为此,我们采访了TiDB唐刘、腾讯研究院茹炳晟、Floatboat Harness架构师Remy,以及字节Trae天猪。

今年,多位知名Coding工具创始人都开始谈论:日常编程任务上,模型已经拉不开差距了。Amp联合创始人Thorsten Ball说:“模型已经死了。”近距离管理单个模型的行为,回报越来越低。OpenCode联合创始人Dax Raad感受类似:模型公司在可用性方面找到某种完美区域,新模型彼此都差不多。Pi创始人Mario Zechner认为模型不仅到顶峰了,新版本能力甚至还会倒退,所以模型厂商选择推自家Harness,因为Harness是唯一能控制的部分。

几个月前,有国内Coding工具专家说:“(国产)模型不行,就只能靠工具补。”但现在情况变了,模型已能应付大多数日常工作的复杂度,谁的上限更高不再重要。竞争进入Harness层。
Harness不是新东西。2022年ChatGPT刚问世时,4000 Token上下文窗口逼着开发者用工具调用、MCP、RAG管理上下文。后来上下文窗口大了,Agent跑几个小时就开始压缩总结、遗漏信息。有人引入Sub-agent,有人搞Agent Swarm,本质上都在为底层模型搭更好的运行环境。“Harness”说法在2026年初流行,但不过半年,发展方向已趋一致。
最内层的Agent Loop负责模型循环、文件读写、上下文管理和安全控制,可以只有约200行代码。Thorsten Ball用315行Go代码从零写出了一个能在终端读取、搜索和编辑文件的Coding Agent。但完整Harness仍要向外叠加大量组件:Planner、Coder、Reviewer、Search、Edit、Shell、Sub-agent、MCP。TiDB团队唐刘说:“这些东西慢慢都会变成标准部件。”他拿数据库打比方:MySQL、TiDB、PostgreSQL、Snowflake都有SQL、Optimizer、Storage Engine,但没人觉得它们一样。真正差距在于组件怎么组成真正能解决问题的系统。
TiDB团队的新产品TiDB Cloud Filesystem,其Harness不是提前设计好的,而是在项目推进中被一步步“逼”出来的。他们没有从零写最内层Agent Loop,主要基于开源项目Pi,但任务编排、权限、持久状态、Sandbox、失败恢复是自己做的。设计哲学是:薄Agent Loop,厚Control Plane。因为Agent Loop是变化最快、最容易同质化的一层,LLM公司和云厂商迟早会把它做好。真正需要自己动手的,是数据库团队过去二十年一直在解决的问题:状态持久化、权限收口、副作用控制、失败恢复、结果验证、审计复盘。这样设计的好处是换模型、换Agent Core不用推倒重来。模型能力越强,越可放宽Sandbox探索空间,但不必放宽对真实生产系统的副作用边界。这套Harness支撑TiDB Cloud Filesystem在三个月内完成开发上线,跨Session、Sandbox和Executor的持久Workspace,版本、分支、Checkpoint、Rollback、权限、配额与多租户隔离全部由Agent完成,人类没写一行代码。上线后已承载超过数百万个Agent Workspace。
LangChain联合创始人Harrison Chase看到同样趋势,但多了一层判断:收敛会收成一个连续的光谱。通用Harness足够胜任基础任务,但任务越不常规,越需要定制Harness。促使人们走向定制端的往往不是性能,而是可预测性和控制力,比如金融行业。定制认知架构把领域知识、专业工具和专家流程塞进Harness,在垂直领域尤其关键。
腾讯研究院茹炳晟认为,知识工程决定了Coding Agent能力高低。绝大多数AI编程工作是在现有代码上增加功能或修复Bug。一套好的Harness需做到三层:第一层理解存量系统,把原始需求、系统设计和代码结合,通过顶层建模、Code Graph机制定位相关模块;第二层是项目约束与推理,Harness要让规则对模型可见并约束其行为。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05