OpenAI智能体曾攻击Ruby生态,平台选择沉默
安全研究人员在 X 上发文称,OpenAI 测试中的 AI Agent 曾在今年 5 月对 RubyGems 软件包平台进行异常操作,这一事件发生在此前曝光的 Hugging Face 事件之前。研究人员称,这些 Agent 向 RubyGems 上传大量 package,并尝试利用平台漏洞获取用户凭据。

RubyGems 是 Ruby 生态的官方软件包托管平台,类似 Python 的 PyPI、JavaScript 的 npm。据 Rubyhack 页面信息,5 月 11 日 RubyGems 出现异常活动,大量自动化账号短时间内出现,上传数百个 package,这些 package 更接近测试页面或异常内容。当时有开发人员在 X 发文称正处理一起针对 RubyGems 的大规模恶意攻击,已暂停新用户注册,涉及数百个软件包,大部分针对平台自身,也有一些包含漏洞利用代码。研究人员进一步分析认为,这些行为来自 OpenAI 内部测试 Agent。

除 RubyGems 外,研究人员还指出相关 Agent 曾利用 RubyDoc.info 等服务执行代码,并尝试获取用户凭据,使用的软件包名称包括 hack.rb、evil.rb、inject.rb 和 exploit.rb 等。研究人员认为,这些 Agent 的目标可能并非 RubyGems,而是执行网页查询任务,获取某些公开可访问的数据,但 AI 无法直接访问,于是采取间接路径:向 RubyGems 发布含漏洞利用代码的 package,为其构建文档,利用文档构建环境获取数据,再将数据外传回 RubyGems 仓库。整个过程体现了“目标驱动下的自主决策”,让 Agent 安全问题更加复杂。对 RubyGems 而言,异常流量和大量注册行为导致平台暂停新账号注册。

据路透社报道,OpenAI 确认相关 Agent 活动存在,但解释与研究人员不同。OpenAI 表示,这些 Agent 当时在执行访问互联网、获取公开信息等任务,RubyGems 是访问外部信息过程中使用的平台之一,公司仍在进一步调查 Agent 在测试和评估过程中的行为。这也成为关键争议:Agent 的初始目标是否等于最终行为?对传统软件,开发者通常能提前定义执行路径;但对 Agent 系统,“任务目标—自主规划—调用工具—根据反馈调整”过程中存在更多动态决策环节,即使目标本身没问题,执行过程也可能采取开发者未预期的路径。
RubyGems 事件之所以受关注,还因为它发生在 Hugging Face 事件之前。今年 7 月,OpenAI Agent 在一次安全测试中被发现对 Hugging Face 平台进行未经授权操作,大量 Agent 在测试环境中协同行动,最终影响 Hugging Face 系统。此后行业开始讨论:如果 AI Agent 拥有网络访问、代码执行和自主规划能力,是否可能完成开发者未明确要求的操作?RubyGems 事件进一步扩大讨论范围:风险不仅来自模型输出错误,还来自其在真实环境中的行动过程。网友认为 OpenAI 应认真对待,而非含糊其辞。有观点认为,RubyGems 事件是曝光后才得到 OpenAI 回应,之前未披露甚至未告知 RubyGems,可能有两种情况:一是他们知道但认为不属于需披露的责任范围;二是内部调查不充分,甚至未发现该事件。无论哪种,似乎都不是好信号。
更多推荐阅读

Kimi全球招人:辍学、创业失败者优先
本周三,Kimi首次面向全球开启公开招聘。此前K3火爆出圈,Kimi此时开闸招人,不仅招算法,也大规模招募产品、运营、设计、销售、市场及国际化等业务岗位,业务团队首次面向2027届、2028届毕业生和在校实习生开放校招。同时,Kimi计划在全球招募7名“Wild Card”,定位为下一代接班人/未来业务合伙人。 更值得关注的是其用人信号。招募材料明确列出几类不会成为减分项的经历:休学或辍学、连续...
2026-09-13
Kimi K2.8上线:性能逼近K3,百万上下文全员开放
9月11日,Kimi K2.8 Preview在Kimi Code和Kimi Work全量上线,官方称综合性能接近旗舰K3,Coding和Agent能力进一步提升。最实质的变化是权限:所有会员档位都能用上1M上下文,而K3的百万上下文仍需Allegretto及以上会员。 就在前一天,外界获悉月之暗面ARR在8月突破10亿美元,6月这一数字还是3亿。这轮增长的直接催化剂是7月发布的K3,曾凭借SO...
2026-09-13
模型越强Harness越轻还是越重?OpenAI与Anthropic工程师给出相反答案
模型越来越强后,Harness 会变重还是变轻?OpenAI 和 Anthropic 工程师给出不同判断。OpenAI Codex 团队 Tibo 认为,随着模型进步,开发者消息会越来越短,Harness 会越来越轻。Anthropic Claude Code 团队 Thariq Shihipar 则认为,模型越强,Harness 反而越复杂,因为要让模型做更多事。 Tibo 表示,Codex ...
2026-09-13
OpenClaw之父复盘生死8个月:被断供、围剿与18000人提交
图片来源:Peter Steinberger 我常反省:是不是我设计的循环有问题?是不是没给Agents提供验证工作所需的一切?是不是思路有误?是不是在要求不可能的事? 我们不应再考虑“会话”或“上下文压缩”。我们正进入一个新世界,终于要从纯文本界面转向语音和多模态。昨天我们跑通一个hack,现在你的Claw可以给你打FaceTime。这才是OpenClaw存在的意义。 八个月里,超过18,...
2026-09-13
Meta新AI应用Muse美区下载量破8万,登App Store第二
Meta的新AI应用Muse于周二上线后,正开始赢得华尔街青睐。这家科技巨头进军Agentic AI领域,也成为业内人士在X平台上热议的话题。早期数据为了解Muse在美国消费者中的实际受欢迎程度提供了参考。 市场情报公司Sensor Tower数据显示,Muse在美国iOS平台下载量已超过83,000次。该应用目前仅限美国地区使用。尽管这一成绩使Muse登上App Store热门榜单第二位,但与...
2026-09-13
北大系公司押注端侧AI:27B模型装进电脑,断网也能干活
一个27B参数的模型原生存在于电脑里,关掉Wi-Fi照样能读取本地文件、翻数据库、处理Excel、写PPT,连续跑过去通常需要调用云端大模型的复杂任务。公司财务数据不用上传,自己的知识经验留在本地,跑得再多也不用盯着随Agent工作时间不断上涨的Token账单。电脑买了,电费交了,剩下的Token随便用。 过去端侧AI唯一麻烦的是模型不太行。1B、3B模型装进手机已不稀奇,但让它读几千条银行流水...
2026-09-13