Claude半年内自我进化加速:从1%到26%

Claude半年内自我进化加速:从1%到26%

AI 资讯 来源:新闻/公众号 发布时间:2026-09-18 更新于 2026-09-18 预计阅读 4 分钟

AI 距离递归的自我改进(RSI)还有多远?Anthropic 给出了一个实际数字:截至今年 8 月,在 Anthropic 内部的 AI 研发工作中,Claude 已主导 26% 的工作,超过 90% 的 AI 研发工作至少进入「AI 协作」阶段。

Anthropic 采用 Epoch AI 的自动化等级,将 AI 参与工作划分为 AL0 到 AL5 六个阶段。AL4 即「AI 主导」,人类只需给出大致目标,AI 就能完成绝大部分端到端工作,人类负责监督、检查和最终决策。例如夜间数据管道故障,AL4 阶段工程师只需把告警丢给 Claude 说「把它修好」,Claude 即可自行查看日志、定位原因、编写修复代码、测试、重跑管道并写好说明。AL5 则连发现问题都不需要人类,AI 可自主监控、修复乃至部署。Anthropic 强调,目前没有任何被测量的 AI 研发工作达到 AL5。

Claude自我进化突然变快:半年时间,从1%到26%

变化速度惊人:2026 年 2 月进入 AL4 的研发工作还不到 1%,8 月已达 26%。Anthropic 在 6 月曾披露,截至今年 5 月,合并进代码库的代码中超过 80% 可归因于 Claude;2026 年第二季度,一名典型 Anthropic 工程师每天合并的代码量约为 2024 年的 8 倍。

为衡量更深层自动化,Anthropic 建立「R&D Automation Index」,从 Slack 和研发文档中抽取任务,整理出约 1.5 万项具体研发任务、542 个节点的研发工作树,再由 Claude Agent 调查并评级。Anthropic 承认「AI 协作」与「AI 主导」边界带有主观性,未来需统一方法并引入第三方验证。

Claude自我进化突然变快:半年时间,从1%到26%

截至今年 8 月,在 Anthropic 使用最多的内部 Agent 平台中,任意时刻约有 3 万个 Agent 从事研究和工程工作,仅 8 月就产生超过 10 亿次决策。这些 Agent 可长时间半自主工作并互相委派任务,公司为每个 Agent 建立持续「身份」,通过共享消息系统沟通,信息标明来源并保留引用,使 Agent 之间既能协作也能互相纠错。

所有 Agent 行为都经过在线监控,100% 的动作在执行前通过 Monitor 检查,通常只需几秒。2026 年 8 月分析的超过 10 亿次决策中,约 0.002% 被阻止。离线监控每周标记约 10 万条对话记录,经多层分类器排除误报后,最高优先级的约 50 条/周升级人工审查。

Claude自我进化突然变快:半年时间,从1%到26%

算力分配方面,2026 年 7 月 13 日至 20 日一周内,用于 AI 研发的算力中约 6% 被划分为安全研究;若只看 AI 驱动的 AI 研发,安全研究约占 12%。

Anthropic 仍明确表示,目前测量范围内没有任何 AI 研发工作达到 AL5。但从不到 1% 到 26% 只用了半年,若趋势延续,到 2026 年底「AI 主导」比例将接近 80%。届时,判断 AI 公司的许多指标的重要性都需重新审视,关键问题可能只剩下智力。

标签: AI 资讯 AI

更多推荐阅读

谷歌DeepMind成立AGI研究所,诺奖得主挂帅

谷歌DeepMind成立AGI研究所,诺奖得主挂帅

几周前,GPT-6 Astra横空出世,OpenAI首次官宣AGI实现。今天,谷歌DeepMind火速成立全新机构——DeepMind研究院(DMI),由Demis Hassabis、Shane Legg与James Manyika联手挂帅。以前的DeepMind只想搞出AGI,现在问题升级为:AGI真的来了以后,全人类到底拿什么接招? DMI专门研究“超级智能”对经济和社会的颠覆性影响,目标是...

2026-09-18
OpenAI前核心成员造出只会做选择题的大模型

OpenAI前核心成员造出只会做选择题的大模型

TypeSafe AI创始人Diogo Almeida曾是OpenAI核心成员,参与创造RLHF和InstructGPT,2024年初离职创业,两年后推出全新模型Jev。该模型只做一件事:高频决策。它无法聊天、写代码或生成文字,是纯粹的通用分类器。 开发者Marcel Pociot用Jev做了浏览器插件,过滤X上不想看的内容,如引战、加密货币、政治争论等。每条帖子Jev在后台判断是否命中分类,平...

2026-09-18
中国电信通用Agent杀入IDC实测前三

中国电信通用Agent杀入IDC实测前三

IDC发布国内首份《中国企业级通用Agent产品技术评估》,中国电信TeleAgent进入前三。此次评估未采用大模型Benchmark,而是用近百道非公开任务考察Agent在真实办公环境中的端到端执行能力。TeleAgent常规任务得分3.49分、复杂任务3.36分,九项能力中任务表现获满分,成本效率为评测最高分。该产品今年4月内部试用,7月推出V1.0,一个多月用户规模已接近120万。 IDC...

2026-09-18
1300张卡击败GPT-6!前OpenAI副总裁造出材料大模型

1300张卡击败GPT-6!前OpenAI副总裁造出材料大模型

前OpenAI研究副总裁Liam Fedus在X上发布Periodic Labs首个模型Periodic Neon:仅用1300张H200,加上数月实验数据,在自研XRD分析基准上超过GPT-6 Astra。Neon约1T参数,在134道高难度X射线衍射分析题组成的FrontierXRD上成功率达55.3%,领先GPT-6 Astra和Claude Fable 5.1。Astra据传总参数数万亿、...

2026-09-18
国产AI存储刷新全球纪录,焱融全栈布局曝光

国产AI存储刷新全球纪录,焱融全栈布局曝光

智东西9月17日报道,9月1日,MLCommons发布MLPerf Storage v3.0基准测试榜单。焱融全闪AI存储F9000X在多项测试中拿下第一,验证其在极限AI训练负载下对高速网络带宽的高效利用能力。 随着AI从模型训练走向规模化推理,存储需处理的数据和任务持续增加。训练阶段要持续向GPU供给海量数据,并快速保存和恢复模型Checkpoint;推理阶段需管理不断膨胀的KV Cache...

2026-09-18
AI短片斩获威尼斯双奖,千万级创作大赛开启

AI短片斩获威尼斯双奖,千万级创作大赛开启

十天前,AI超创DiDi_OK的《网站》在2026年威尼斯Reply AI Film Festival上斩获评审大奖与观众选择奖双料大奖。该片从76个国家3100多部作品中脱颖而出,评委包括奥斯卡得主和《狮子王》联合导演。影片用十来分钟探讨“观看能否改变现实”,凭借画面与叙事功力成为本届唯一同时获得两项大奖的作品。这类会讲故事的AI创作者,正是当下AI行业最稀缺的人才。 今天,虎鲸文娱集团正式启...

2026-09-18
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部