AI Agent正确率从26%飙至70%,去中心化蜂群协作如何做到?
Agent(智能体)并非新概念,但传统工作模式存在一个显著痛点:总Agent接收任务后,若判断复杂,便拆分给多个子Agent分别处理,最后再统一汇总。然而,所有结果需经总Agent重新理解,这一环节可能导致子Agent已找到的正确答案在整理时丢失细节。中国团队EvoMap提出的“去中心化蜂群”组织方式,试图从根本上解决这一问题。

在蜂群模式下,多个Agent平级分工、各司其职,完成后由程序按任务编号直接汇合结果,省去了总Agent转述环节。同时,Agent可将已验证的方法保存,供其他Agent复用并持续更新,这一方向被团队称为“AI for AI”。

该团队已将这一能力落地为桌面Agent产品EvoX。测试中,用户向EvoX提供咖啡店背景、成本、排班等资料,要求制定一份七天开业周方案。开启“蜂群”按钮后,EvoX自动拆解任务并调用5个Agent并行处理,最终输出包含每日安排、排班、菜单活动、宣传计划、预算及风险提示的完整方案。

蜂群模式与普通Sub-Agent模式的核心区别在于结果汇合方式。团队实验显示,在563道逻辑、数学和物理题中,使用同一模型,单Agent正确率仅为26.29%,Sub-Agent模式为38.54%,而EvoX蜂群模式达到70.69%—70.87%。值得注意的是,Sub-Agent模式中,子Agent答对373题,但经总Agent汇总后仅保留217题,正确答案保留率仅55.5%。这说明大量错误并非源于子Agent能力不足,而是汇总环节的信息损耗所致。蜂群模式通过直接汇合,避免了这一损耗,正确率因此大幅提升。

EvoMap是2025年成立于深圳的创业公司,团队不足20人,多为95后和00后。EvoX是其面向普通用户的入口,而EvoMap则是其搭建的Agent经验网络。在后续测试中,用户为新任务(中秋活动方案)仅提供新的预算、人员等数据,EvoX自动调取并复用了上一轮咖啡店方案中的四条经营规则,无需重复说明,且方案生成更快、内容更详细。这种经验复用能力,让Agent能够像人类一样积累“行业常识”,并不断优化。

该团队还将蜂群与经验迭代应用于复杂研究,推出已开源的AutoResearch。其中不同Agent分别负责方案提出、实验执行、测试与检查,成功的方法进入下一轮,失败经验则作为修改依据。在官方Django修复实验中,新增功能测试从2/7提升至7/7,同时保持203/203项回归测试通过,展示了这一模式在真实软件开发中的潜力。
未来应用场景可进一步拓展:例如暴雨导致订单激增时,不同Agent可尝试优化合单、派单及取餐路线,成功经验连同天气、订单密度等数据保存,供其他区域相似情况复用。类似经验也可用于餐厅备餐、物流路线调整等生活服务场景。
当前多数Agent仍模仿人类操作软件,但机器天生擅长并行处理与精确汇合,并能保存机器可读的经验。EvoMap正探索属于Agent自身的组织与经验系统,使AI开始优化AI,形成自己的协作方式,并将有效方法保存、分享与迭代。EvoX与AutoResearch已展示初步成果,而这一去中心化协作范式,或许将重新定义Agent的工作方式。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05