GPT-6.1 Sol深夜突袭:1/5价格逼近Astra
在OpenAI开发者大会上,GPT-6.1 Sol突袭上线,并已接入Codex和ChatGPT Work。据称原定的GPT-6.1因对齐回归问题被紧急暂停,OpenAI转而推出这款“干活特化版”。官方口号是“以五分之一的价格,获得接近Astra的智能水平”。

价格方面,GPT-6.1 Sol的API标准价为输入2美元/百万Token、输出10美元/百万Token,恰好是GPT-6 Astra(输入10美元、输出50美元)的20%。缓存读取价仅0.10美元/百万Token,比标准输入便宜95%,缓存写入为2.50美元/百万Token,使其在运行Computer Use、代码生成Agent时成本极低。

性能上,编程能力(DeepSWE v1.1)以五分之一成本打平Astra,比旧版6 Sol提高6.4个百分点;电脑操作(OSWorld 2.0)距Astra仅差2.1分,单任务成本约为其七分之一;专业办公(AutomationBench)中等推理强度下比Opus 5.5高2.2个百分点,成本仅三分之一;GDP.pdf测试中各档推理设置得分均高于带回退机制的Opus 5.5,单任务成本不到其一半;Terminal-Bench Science得分是旧版两倍,单任务成本仅5.47美元,而Astra和Opus 5.5均需23美元以上。内部对齐评估中,它相较GPT-6 Sol改进重大,更接近Astra,在透明度和可靠性上表现更好。

45页系统卡显示,GPT-6.1 Sol思维链可控性极强:生成750至1250个Token长度思维链时,成功遵循格式和控制指令的比例达44.8%,而GPT-5.6 Sol仅16.1%。大V@scaling01称这基本证实它是更小的循环模型,专为后台自我反思、自我纠错、不断循环思考而生。系统卡还披露其网络安全能力被内部评定为“Critical”级别,内部零日漏洞开发测试中任意代码执行成功率达21.5%,碾压GPT-6 Sol的5.5%,仅次于Astra的31.5%。
实测方面,@notjazii用同一高难度提示词对比:GPT-6.1 Sol耗时10分钟、花费1.50美元;Claude Sonnet 5.5耗时50分钟、花费9.21美元;GPT-6 Astra耗时25分钟、花费11美元;Claude Opus 5.5耗时45分钟、花费13.50美元。结论是6.1 Sol输出甚至比Astra更好,只花零头钱。Higgsfield让6.1 Sol和Astra做同一3D游戏原型,6.1 Sol以1/5成本、快4倍速度完成。Bindu Reddy评价其漂亮地转移了“智能vs成本”的前沿阵地。
跑分上,AA Intelligence Index中GPT-6.1 Sol(Medium档)得48分,追平上一代GPT-6-Sol的Max档;Max档得52分,距Astra Max档53分仅差1分。LuminaBench测试3D Colosseum提示词后表示Astra和新Sol感觉几乎一样,但仍被Anthropic的Opus和Sonnet碾压。@kickingkeys对比JS视频生成能力,两者几乎不相上下。
GPT-6.1 Sol透露出OpenAI战略转变:从“先发最强”变成“先发最能干活”。目前只对Plus及以上付费用户开放,普通Chat不可用。即日起所有Plus、Pro、Business、Enterprise和Edu用户均可在ChatGPT工作区和Codex中使用,开发者可通过API调用gpt-6.1-sol,同时推出最高提速8倍的Ultrafast版本专供高阶开发者。在前端和画图上它暂时打不过Sonnet 5.5和Opus 5.5,但在多步骤逻辑、大规模代码Agent和成本控制上直接掀翻桌子。
更多推荐阅读

AI编程“计划模式”刚成标配,就有人宣布它已死
这两天,Hacker News 上一篇《Plan mode is dead》引发关注。作者 Ayman Nadeem 是 YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO。她曾坚信规划是 AI 编程最重要的环节,并围绕这一判断打造桌面编程应用,但几个月后改变了看法。文章触及 AI 编程工具中一条正在松动的产品假设:写代码前,人要先整理出完整计划再交给 Agent。 Nadeem 认...
2026-09-30
齐俊元再创业:Today AI上线,要做更懂你的个人AI助理
9 月 28 日,Manus 发布 2.0 版本,并推出独立的个人 Agent 应用 Cue。每个 Agent 拥有自己的邮箱、电话、钱包和电脑,可以替你接电话、发消息,并在设定预算内付款。 海外 Personal Agent 赛道已相当热闹。Meta 的 Muse 上线 10 天在美国获得 73 万次下载,登上 App Store 免费榜第一。GrokBot 借助 X 的分发能力入场,Town...
2026-09-30
Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑
Personal Agent正在成为下一个风口。 过去三周,Meta发布的个人AI助手Muse成为科技圈最大变量。该应用9月8日上线,仅10天就登顶美国App Store免费应用总榜,第12天全球安装量达280万。9月21日,Meta单日股价上涨11.43%,市值增加近2000亿美元,此后股价稳定在700美元以上。 Muse为每个用户配备独立云端虚拟机,用户通过手机即可浏览网页、操作应用、发邮...
2026-09-30
腾讯秘密开发Personal Agent产品Handy Bot
腾讯正在秘密开发Personal Agent产品“Handy Bot”,并计划推出独立App。目前已在微信端低调上线服务号,简介为“Your Personal AI Agent”。产品仍处内部测试阶段,信息以官方口径为准。 当前行业正热议Personal Agent叙事,Meta刚推向市场的Muse将消费级智能体热度推至新高。传统Chatbot属会话驱动,一问一答,会话结束任务终止;Person...
2026-09-30
视频超分不再“变样”!RH Upscale 13组横评综合第一
视频超分长期面临两难:传统方法能拉高分辨率,却难以找回丢失的细节;生成式方法能补细节,却可能导致人物变样、构图偏移,在视频中还会出现闪烁和拖影。画面要更清楚,原内容又不能被改掉。 海马云旗下 RunningHub 发布自研生成式视频超分模型 RH Upscale,目标为“放大而不改内容”,在提升分辨率、恢复纹理的同时,尽量保持人物、构图、色调及运动过程的一致性。在 13 组横向评测中,RH Up...
2026-09-30
320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格
就在昨天凌晨,一个320B的开源大模型IQuest-Q1发布,权重和blog一并公开。九月赛道竞争激烈,GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash及国产Qwen3.8、GLM-5.3等接连发布。IQuest-Q1由至知创新研究院(IQuest Research)推出,在写代码库、挖安全漏洞和长程复杂任务等硬核评测中与头部模型同台竞技。 研发团队一次强化学习训练中...
2026-09-30