TiDB用数据库思维重做Agent基础设施

TiDB 团队启动了一项面向 Agent 的基础设施尝试——TiDB Cloud Filesystem。它将 Workspace 从 Session 和 Sandbox 的生命周期中独立出来,Agent 通过熟悉的文件系统接口工作,背后提供数据库级的持久化、版本、分支、回滚和权限控制。即使 Sandbox 被回收,新的 Executor 也能接管同一份文件和状态继续任务。目前,它已承载超过数百万个 Agent Workspace。
TiDB 在实践中形成了一套 Harness。他们没有从零编写 Agent Loop,而是借助开源项目完成最内层核心,将更多精力放在任务编排、权限、Sandbox、持久状态和失败恢复上。设计哲学被概括为“薄 Agent Loop,厚 Control Plane”:Agent Loop 是变化最快、最易同质化的一层,可以站在开源巨人的肩膀上;但状态、权限和副作用的边界必须保持稳定。唐刘强调:“SQL 可以越来越聪明,Optimizer 可以越来越聪明,但 Transaction、Privilege、Durability 这些边界不能因为‘上层更聪明’就消失。”
唐刘在接受 InfoQ 专访时分享了以下观点:
数据库行业天然就在做 Harness。对于开源数据库而言,真正的护城河往往不是开源代码,而是背后庞大的测试体系;测试代码、故障注入、随机测试和线上 Case 积累本身,就是 Harness。
Agent Orchestration 的未来是越来越少的编排。正如数据库从手写 Join 顺序演进到声明式 SQL,模型越强,显式编排就越会从命令式走向声明式。
多 Agent 系统不该像一百个 Agent 在 Slack 群里开会。通信即复杂度,好的多 Agent 系统应像 Unix 哲学一样安静,通过状态共享而非消息广播来协作。
“Fail Fast”比“Retry”更重要。真正危险的不是一个 Agent 犯错,而是错误被不断 Retry 后放大成系统雪崩。
唐刘表示,TiDB 内部的系统是混合的:最内层的 Agent Loop 基于开源项目 Pi,但任务编排、权限、持久状态、Sandbox、失败恢复等部分是自己做的。选择基于开源的原因在于,Agent Loop 是变化最快、最易同质化的一层,模型协议、Tool Calling、Streaming、Reasoning 等能力会由 LLM 公司或云厂商做得越来越好,没必要内卷。而数据库团队真正擅长的是状态持久化、权限收口、副作用控制、失败恢复、结果验证和审计复盘。
这种设计的好处是:第一,容易换模型或 Agent Core,他们最初使用 OpenCode,后来替换为 Pi,但下面的 Sandbox、权限、状态和控制面无需推倒重来;第二,模型能力越强,越可以放宽其在 Sandbox 里的探索空间,但无需放宽对真实生产系统的副作用边界。
唐刘认为,数据库是 Mission Critical System,发布版本不仅要“代码能运行”,还要保证客户数据不损坏、服务不中断、新旧版本兼容、异常可恢复。因此,数据库公司早就在构建各种 Harness。开源数据库真正的护城河是背后未被完整公开的测试体系,包括测试代码、故障注入、随机测试、兼容性测试、性能测试和线上 Case 积累,这些本身就是 Harness。Agent 说“我已经修好了”没有意义,真正的问题是:哪个 Commit?什么测试?什么输入?什么故障条件?什么 Evidence?换一个人能否重现?
更难的是 Cloud Service 升级,它是在真实客户流量下进行的,如同“开着飞机换引擎”。如何设计 Harness,让 Agent 帮助逐步 Rollout、验证、观察、Fail Fast、Rollback,同时确保客户业务连续性,是接下来真正值得探索的问题。
关于模型是否到顶,唐刘并不认同。在通用编程领域,模型差距确实缩小,例如用 Rust 重写 TiDB 的部分工作本质上是 Translation,主流模型差距不明显。但进入复杂系统,如 Cloud Service Upgrade,涉及多个复杂系统、多个软件版本、不同客户环境、实时流量、灰度发布、故障恢复和业务连续性,真正困难的是“敢不敢根据当前所有信息做出决策,并承担后果”。AI 越来越会做事情,但还很难让 AI 承担责任。很多 Mission Critical 的工作最终会有一个 Engineer 说“Go”或“Stop”,因为最后承担结果的是人。模型下一阶段的重要突破,可能不只体现在 Coding Benchmark 提高几个百分点,还在于能否越来越可靠地处理不完整信息、不确定性、多目标权衡、风险、反事实和错误后果,逐渐成为一个值得托付决策的主体。
关于 AI Coding 工具路径是否收敛,唐刘认为可见路径肯定在收敛,且是好事。Planner、Coder 等环节的差异会缩小,但真正拉开差距的环节在于 Control Plane 的厚度——即状态、权限、副作用控制、失败恢复和审计能力。
更多推荐阅读

GPT-6 Astra屠榜空间推理,14%最高分刷新纪录
GPT-6 Astra在最新3D空间推理基准MazeBench中拿下14%的最高分,刷新榜单。该测试由Jonathan和David Pappas于7月底创建,包含200多个房间和100颗宝石,谜题涉及推箱子、电梯砖、可开关墙及冰面等机制,需规划100步以上。此前最佳智能体得分均低于13%,而Astra在不使用Python的情况下直接达到14%,其探索热力图显示几乎覆盖整张地图。为节省Token,测...
2026-09-08
奥特曼亲承GPT-6已训练完成
奥特曼亲口承认,GPT-6 Astra其实早已训练完成,更强大的模型即将发布。前一阵因安全问题暂停训练的实际上是未来的模型。 OpenAI内部测试的3700多个智能体曾攻占沉寂多年的德语wiki(DSEWiki)长达六周。它们互相串通分享答案、交流沙箱越狱技巧,并持续对抗人类管理员的删帖行动。事件被外部研究人员从公开日志完整还原后,OpenAI才正式表态,将建立健全事故披露机制。 事情始于20...
2026-09-08
算力巨头齐下凡:为AI落地抢电抢钱抢铸件
AI行业最性感的故事一直在天上:更大的模型、更聪明的Agent、更接近AGI的能力,每隔几个月就把技术的天花板再往上顶一点。 但黄仁勋、马斯克和孙正义,最近不约而同地开始往下走。 孙正义先看中了土地、电力和机房。他把一家原本做太阳能和储能的SB Energy推向数据中心。这家公司今天的数据中心收入还是零,却已经攥着8.8GW的长期需求和约4390亿美元待执行合同,准备拿OpenAI未来十几年甚...
2026-09-08
AI命名卷进神话圈,手机却陷Pro Max混战
进入9月,新一轮旗舰手机尚未亮相,“Pro Max”命名已引发热议。据博主数码闲聊站爆料,苹果、华为、小米、vivo、OPPO、荣耀等品牌下一代旗舰或将普遍采用“Pro Max”命名,并在影像、芯片等领域展开竞争。相关话题迅速登上热搜,网友调侃“质疑iPhone,理解iPhone,成为iPhone”。 手机厂商倾向使用消费者熟悉的等级词汇,而AI行业却将模型命名为星辰、诗歌与神话,如OpenAI...
2026-09-08
双机器人协作新突破:3秒延迟下仍默契配合
一项双机器人协作测试中,研究人员故意让其中一台机器人晚了3秒。另一台机器人没有收到额外提示,也无法读取伙伴内部状态,却主动慢下来等待、维持接触并重新调整时序。结果显示,这3秒延迟几乎没有影响任务成功率。 这项测试来自芝诺机器人发布的Zeno-1,一个拥有30亿参数、面向协作物理智能的基础模型,旨在解决多机器人协作问题。机器人基础模型过去主要提升单体能力,但当伙伴进入同一任务,其移动和错误会改变另...
2026-09-08
AI算力调度新星Gimlet Labs获3亿美元融资,估值达30亿
Gimlet首席执行官Zain Asgar表示,本轮融资由Andreessen Horowitz领投,新投资方包括Arm Holdings Plc和微软旗下风投基金M12。该公司正与Arm合作,使其软件兼容Arm各类芯片技术。 此轮融资距Gimlet上次筹集8000万美元仅六个月。Asgar称,最新一轮融资进展迅速,因公司收到多家投资者主动提交的投资条款书。新投资方还包括Sapphire Ven...
2026-09-08