Anthropic首曝:3万AI智能体正自我迭代

Anthropic首曝:3万AI智能体正自我迭代

AI 资讯 来源:新闻/公众号 发布时间:2026-09-18 更新于 2026-09-18 预计阅读 3 分钟

Anthropic首次公开内部三大AI研发指标,揭示递归自我改进(RSI)正在其实验室真实上演。

刚刚,A社首曝RSI绝密报告:3万智能体正自我迭代!

第一项指标关于AI参与研发的程度。Anthropic依据Epoch AI六级自动化标准,对内部研发流水线进行评估。2026年7月,其随机抽取模型研发部门20%员工,用Claude研究智能体分析其Slack记录和内部文档,梳理出15000项研发任务、542个任务节点。截至2026年8月,Claude尚未在任何单一子任务上实现完全脱离人类的L5级闭环,但已能自主主导26%的核心研发工作——人类只需给出宏观指令,端到端工作由AI完成。达到或超过“人机深度协同”的研发工作占比突破90%。若26%升至50%乃至100%,机器迭代机器的速度将指数级爆发。

刚刚,A社首曝RSI绝密报告:3万智能体正自我迭代!

第二项指标关于Agent规模与管控。Anthropic最常用内部平台上日常并发运行约3万个研发智能体,全天候写代码、相互派任务。为此其建立双层监控:第一层为100%实时在线拦截,8月追踪超10亿次智能体决策,阻断警报率0.002%,约2万次越界操作被暂停;第二层为离线监控与人类终审,每周纳入全部行为记录,筛出约10万份可疑日志,最终将最高优先级50起异常事件交人类专家审核。架构上采用独立身份(每个Agent有独立标签与记忆,不绑定底层模型版本,便于追责并让Agent将他人数据视为待验证声明)和透明广播机制(取消私聊,所有沟通在公共可追溯总线上进行,Agent间可纠错)。

刚刚,A社首曝RSI绝密报告:3万智能体正自我迭代!

第三项指标关于算力分配。Anthropic调取2026年7月13日至20日算力快照,用Claude对近1万次运行记录抽样分类。结果显示,整体AI核心研发算力中仅约6%划拨给安全研究(对齐、可解释性、安全红蓝对抗等),AI主导研发算力中该比例约12%。Anthropic解释称,安全研究依赖高端人类脑力而非算力,且该估计极度保守:凡“既有助于安全又有助于能力提升”的任务一律不计入安全算力,也不含日常有害信息过滤分类器算力。其认为算力最易量化核实,建立该标准后,监管机构可要求全行业公开安全算力占比。

Anthropic最后表示,当世界考虑如何控制前沿AI发展速度时,必须缩小前沿实验室与公众之间的信息差,任何前沿开发者都可发布同样标准并由第三方验证。此举被视为对全行业的公开挑战:跟进则提升透明度,不跟进则可能被质疑隐瞒。

标签: AI 资讯 AI

更多推荐阅读

智象新模型实测:视频生成开始理解真实世界

智象新模型实测:视频生成开始理解真实世界

近几月,AI视频生成赛道持续升温。7月31日,Seedance 2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;9月,智象HiDream-O1-Video-1.0(简称HiDream V1)发布并冲上权威榜单全球前四。以字节Seedance、MiniMax H3、阿里Wan 3.0和智象HiDream V1为代表的中国模型,开始在全球主流榜单头部形成集群,从“单点领先”转向“多家...

2026-09-18
OpenAI总裁证实另一千禧年难题获重大进展

OpenAI总裁证实另一千禧年难题获重大进展

上周,OpenAI宣布在纳维尔-斯托克斯方程相关问题上取得突破,引发全球关注。随后,联合创始人兼总裁Greg Brockman公开表示,在另一个千禧年大奖难题上也取得了重大进展。外界传闻称,OpenAI可能已实质性解决全部六个未解千禧年难题中的两道,并猜测在即将到来的开发者大会上,奥特曼与Brockman可能掏出“终极底牌”。 目前未解的千禧年难题包括:P与NP问题、黎曼猜想、杨-米尔斯规范场与...

2026-09-18
OPPO姜昱辰:大模型差距在缩小,AI手机差距才刚拉开

OPPO姜昱辰:大模型差距在缩小,AI手机差距才刚拉开

OPPO ColorOS 智慧产品研发总监姜昱辰给 AI 手机下的定义是:「以意图驱动的手机就是 AI 手机。用户说一句话,手机就能把事情办了,不需要再打开 APP、反复点击。」按此标准,包括 OPPO 自家产品在内,目前没有一台手机可称为 AI 手机。但做出这样的手机正是 OPPO 的目标。 OPPO 的答案是不与大模型公司争云端模型,把核心能力压在端侧,将手机做成真正的 Personal A...

2026-09-18
智谱10万国产卡两周让GLM优化自身推理系统

智谱10万国产卡两周让GLM优化自身推理系统

两周时间,10万颗国产AI加速器,一个开始优化自己的模型。智谱GLM首席科学家唐杰在X平台分享了一项关于GLM-5.3-Flash推理系统优化的研究。他透露,从GLM-5.3-Flash首次运行在国产AI加速器上,到完成全部生产流量承载,仅用了两周时间,系统端到端吞吐能力提升了3.2倍。最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由GLM-5.3驱动的Infra Age...

2026-09-18
Manus拆分后首轮融资33亿 估值翻倍至268亿

Manus拆分后首轮融资33亿 估值翻倍至268亿

据彭博消息,Manus正计划完成约5亿美元融资,估值有望达40亿美元,较此前20亿美元估值翻倍。知情人士称交易已接近完成,但仍处早期阶段,条款和投资者名单可能变化。这是Manus从Meta分拆后的首笔融资,若谈成将成为中国通用AI智能体赛道估值最高的公司。现有投资方包括腾讯、HSG和真格基金,未来可能效仿月之暗面寻求赴港上市。 Manus于2025年初在武汉和海淀成立,做AI智能体产品,邀请码一...

2026-09-17
Gemini 4 Pro疑伪装现身盲测,2M上下文泄露

Gemini 4 Pro疑伪装现身盲测,2M上下文泄露

今天上午,有用户在Code Arena的battle模式中抽到标着gemini-3.8-flash的模型,让其用HTML画一只鹈鹕骑自行车的2D SVG动画。结果鹈鹕有完整踩踏动作,背景会切换场景,嘴里还叼着一条鱼。将“鹈鹕”换成“提壶”后,生成的开水壶精骑自行车同样惊艳:壶盖冒热气,车后座绑着茶叶包,炉火温度和踏频都做成了可调控件。而正常3.8 Flash跑同一提示词,只出来一只方块拼成的静态鸟...

2026-09-17
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部