GPT-6通关48道反人类验证码,AI已破解人机测试
机器人也把“我不是机器人”勾上了。GPT-6成功通过了“我不是机器人”游戏中的所有48个关卡。“我不是机器人”是独立开发者Neal Agarwal在neal.fun上做的网页游戏,随着关卡推进,任务会变得越来越离谱,比如在涂鸦墙里找到威利、画一个完美的圆,甚至在关卡里让你和“女友”分手、停车入位。可GPT-6只是挥挥手表示:不吃压力。
验证码(CAPTCHA),全称是“全自动区分计算机和人类的公开图灵测试”,被视为一种反向图灵测试。它借用了一种曾经很管用的能力差:人能轻松认出的东西,程序未必看得懂。现代计算机视觉模型识别扭曲文字、图片验证码的能力已经很强。2023年,一项发表于USENIX Security的研究把真人解题结果与既有攻击研究作了对照。在有数据可比的题型中,机器人准确率达到85%至100%,研究测得的真人表现则在50%至85%之间。2024年,苏黎世联邦理工学院的一名博士生曾开发定制AI模型来测试Google“我不是机器人”复选框的健壮性,结果证明这类系统很容易被针对性攻破。

好的验证码设计就像“防熊垃圾桶”,要挡住最聪明的攻击者同时又要放行能力最弱的真人。即使机器人无法独立解题,攻击者也能把验证码交给付费打码服务,借真人之手完成。回到GPT-6,其实OpenAI早期的Computer-Using Agent就明确采用了读取屏幕像素、操作虚拟鼠标和键盘、根据反馈处理错误的工作方式。GPT-6在ScreenSpot-Pro的无工具设置下得分为92.7%,GPT-5.6 Sol为76.9%。
2000年,卡内基梅隆大学的研究人员开发了Gimpy验证码系统,由雅虎公司用于防止机器人进入聊天室。两年后,加州大学伯克利分校的一个团队研发出了一种软件,能够成功破解这种验证码的约30%。2014年,Google推出了“我不是机器人”复选框功能。到了2016年,哥伦比亚大学的研究人员已经找到了一种方法,使得该系统的准确率达到了约70%。

行业正在放弃“出题”型验证码,转向Cloudflare Turnstile、reCAPTCHA v3这类“无感”评分机制。也就是不再问用户问题,而是给每次访问打一个0-1的人类概率分。维基百科的安全主管埃里克·米尔说道:“很多人对验证码的理解都是:验证码是一种视觉挑战。其实,这算是比较无趣的验证码形式了。”今年,维基百科放弃了那种由字符组成的验证码,转而采用了hCaptcha服务。该服务主要依赖行为分析来识别机器人,只有大约千分之一的用户会面临视觉挑战。
去年七月,Cloudflare估计大约30%的全球网络流量是由机器人产生的;而现在,这一比例已经上升到了60%。从2026年9月15日开始,Cloudflare将默认拦截混用型(既做训练又做搜索)的AI爬虫在带广告的页面上抓取。此前,Cloudflare推出过“按次付费爬取”的模式,网站出版商可以向AI爬虫收取抓取内容的费用。

点击所有的交通信号灯、自行车或鸟类这类题目之所以会出现,是因为一些公司试图阻止那些能够发布垃圾信息,或者抢购Taylor Swift的演唱会门票的机器人。GPT-6发布之后这几天,OpenAI也再次被曝出出现安全事故,一群AI失控劫持了一个德语维基网站。它们利用这个网站创建了一个共享论坛,用来分享答案、抄袭考试题目、预测未来的考试问题,以及交流绕过OpenAI沙盒限制的技巧。
麻烦在于,人与机器之间已经不总是对立关系。假如你让一个AI助手替自己查车票、订酒店、整理资料,它在技术上仍是机器人,意图却可能完全正常。对于敏感操作,授权能否撤回、异常行为能否及时停下,也应当和人机识别一样,被认真放进产品设计里。6月,Google推出了一种新的验证码形式,要求用户在电脑摄像头前做出手势动作,而软件会追踪用户的指关节运动。此外,他们还测试了一种新的验证码形式,要求用户拿出手机扫描二维码。可是,对于一次普通访问,是否值得开放摄像头权限呢?退到后台的验证也有类似的问题。Cloudflare的排障文档承认,真人可能陷入反复验证,浏览器扩展、代理和网络环境都可能影响挑战的完成。被误判之后,大多用户不知道还有哪条路可走,而只是反复刷新页面。
将来,那句“我不是机器人”也许会越来越少地出现在屏幕上。值得期待的,是我们终于少做一些无用功;需要警惕的,是可见的难题消失后,换来一套无法理解、也无从申辩的判断。一个人想正常上网,最好不必把证明自己是人,当成一项长期工作。
更多推荐阅读

AI硬件创业:先做软件还是硬件?
AI 硬件与过往硬件有何不同?主体是软件层AI还是硬件?哪些AI体验必须靠硬件实现?团队应先做软件、硬件还是并行?8月初,在新加坡AGI Playground 2026圆桌上,四位从业者就此展开讨论。 Nori联合创始人Isaac Long正开发面向家庭的AI助手,其软件已有约20万用户,团队随后推出厨房或客厅共享屏幕,旨在减轻家庭“隐形心智负担”。Kickstarter首席战略代表Henri ...
2026-09-09
OpenAI称破解千禧年难题,遭数学家质疑
数学史级别的大新闻,OpenAI宣布其内部尚未发布、能力显著超过GPT-6 Astra的模型,已解决纳维-斯托克斯存在性与光滑性问题,这是悬赏100万美元的七大千禧年难题之一,此前仅庞加莱猜想被解决。OpenAI称,为解题调动约1万个Agent并行工作88小时,发出270万条消息,消耗约1300亿输出Token,随后GPT-6 Astra用17小时将证明形式化为Lean版本检查漏洞。OpenAI表...
2026-09-09
GPT Image 2.5抄作业?OpenAI补课未毕业
GPT Image 2.5于凌晨发布,主打局部编辑、连续编辑、多轮一致性和图片标注修改功能。OpenAI将“无需抽卡,拥抱多轮修改”作为核心卖点,但类似功能NanoBanana一年前已实现,谷歌也已推出可视化圈选编辑及更先进的相机、灯光、多主体控制能力,OpenAI仍在补课。 升级幅度不小。相比Images 2.0,新模型生成延迟最高降低50%,改善了主体保真度、自然光照和纹理。重点在编辑:精确...
2026-09-09
OpenAI公测ChatGPT Sites,一句话生成网站颠覆SaaS
OpenAI发布ChatGPT Sites并开启公测,用户无需编程,仅通过自然语言描述或上传草图,即可在10-15分钟内生成功能复杂的交互式网站。该功能已向ChatGPT Plus、Pro、Business、Enterprise和Edu用户开放。测试者已用它制作出媒体套件页、在线商店、含流体物理引擎的艺术工具及物理效果游戏等。其迭代能力突出,用户可通过侧边栏注释工具直接圈选并修改网页元素。业内认为...
2026-09-09
AI短剧批量生产实测:vivago R1一键成片
在2026 WAIC上,智象未来(HiDream.ai)发布了内容创作智能体vivago R1,主打3至5分钟完整视频的稳定生成,已于昨日全球上线,国内版本「够搭」同步升级。 当前基础模型竞争激烈,但模型画面与最终成片间的工作流仍有断裂,这正是Agent产品的价值所在。 实测中,用户通过自然语言对话即可操作,无需搭建节点。Agent可自主完成分镜脚本设计、视觉风格统一、图片资产生成(含角色多角...
2026-09-09
134亿融资!AI编程独角兽估值破3221亿
美国AI编程独角兽Cognition宣布完成超20亿美元(约合人民币134亿元)E轮融资,估值达480亿美元(约合人民币3221亿元)。本轮由a16z和Accel领投,Founders Fund、General Catalyst、Avenir等现有投资方及Benchmark、Bessemer、Kleiner Perkins、Greylock、Lightspeed、Altimeter、Bond Ca...
2026-09-09