GPT-6 Luna实测:最便宜模型也能干活了

GPT-6 Luna实测:最便宜模型也能干活了

AI 测评 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 5 分钟

GPT-6 Sol和Luna上线,OpenAI给出的重点是价格。Sol的API输入每百万token 2美元、输出10美元;Luna输入0.1美元、输出0.5美元,均为对应GPT-5.6价格的一半,Luna成为本轮最便宜型号。

实测GPT-6 Sol和Luna,便宜模型已经能干到这一步了

作者用同一网站复刻案例测试Luna High。该站首页以大面积黄色铺底,中间有金色唱片,鼠标移动会触发背景流动反馈,并含大量作品图片和动效。Luna自行整理公开品牌素材、字体、作品图片和页面配置,也找到部分3D几何与贴图路径,但路径无法返回可用模型数据,于是改用CSS重建唱片,并用WebGL画布模拟鼠标流体反馈。最终交付一个本地可运行网页,首屏、作品区、导航、卡片悬停、滚动显现和移动端菜单齐全,鼠标经过黄色区域会留下动态轨迹。它未复原完整3D场景和准确shader,属近似重建,但整体感觉优于MIMO Pro自有桌面端效果,可能与底层harness不同有关。

实测GPT-6 Sol和Luna,便宜模型已经能干到这一步了

随后测试Sol High。参考视频中,花束点击后冒出小方块,网格抬起、花朵散开,最终变成二维码,再点则倒放。Sol第一版用粒子聚散表达变化,但花束、花瓶和二维码间缺乏空间联系;重做后,每个格子做成独立Three.js立体方块,花朵拆成可移动几何体,点击后码块铺开、网格抬起转向镜头,花枝花瓶同步收拢,花朵移向深色码块,最后缩小留下可扫描二维码。输入链接后,网页会先生成二维码矩阵,再逐格摆放3D码块。

实测GPT-6 Sol和Luna,便宜模型已经能干到这一步了

旅行绘本案例中,Sol第一版把纸张做成整块硬板绕书脊旋转,缺少页角翘起和下一幅画提前露出的逻辑,修改后才勉强可用。建筑动画案例中,它做出同一栋现代住宅的连续生成:先有轮廓、楼板、屋顶、泳池和场地网格,再长出白色体块、墙面与二层结构,随后出现玻璃、木格栅、家具、台阶、树木和泳池细节,最终接入材质、室内亮灯、水面着色,进入傍晚。机械表拆解案例中,Sol做成八层结构,拆解进度可手动拖,镜头角度会变化,齿轮旋转、摆轮往复,完全拆开后可通过部件目录查看各层并重新组装。

绘画动画案例中,Sol第一版用Canvas控制显影和颜色变化,并给水面加位移,但水和树没有活起来,画面像简单矢量插画。之后改为高质量绘画素材负责主体,柳树单独做透明图层,JavaScript负责线稿显影、逐步上色、水面位移、动态反光和树枝摆动。Blender版3D房间作品集案例中,Sol先在Blender生成房间,再导出约3MB GLB给Three.js使用。房间约403个对象,含房屋结构、书桌、电脑、抽屉柜、转椅、钢琴、百叶窗、书架、灯串、盆栽、便签和画框,还加了一只原创小猫,并保存可继续编辑的blend文件。用户可拖动缩放,点击木牌打开内容,点电脑看作品,点钢琴看灵感实验。

整体测试后,作者并未觉得模型突然跨出很远,也没有哪个案例解决了过去完全做不到的事。更明显的变化是,类似任务可交给更便宜模型,且敢让它多跑几轮。OpenAI公布的DeepSWE 1.1中,Sol最高推理强度68.8%,Luna为66.6%,差距远小于价格差距,Luna输入输出价格仅为Sol二十分之一。实际体验中代码质量偶尔不稳定,稍复杂任务第一版通常不及格。但旗舰模型不必接管每一步,像网站复刻,Luna已能给出可继续迭代版本;日常开发、小工具、页面实验和素材整理可先让便宜模型处理,任务更长、参考资料更多或涉及Blender等外部工具时再拉入Sol,成本更合理。

Luna输入每百万token 0.1美元,使许多原本犹豫是否反复跑的任务低到可大胆试错。本轮模型竞争价格明显下压,Flash系列频出,Claude Opus 5.5同日发布时Anthropic也把成本下降当重点。对普通用户而言,不一定每天需要最顶模型,更多只是做网页、修交互、复刻效果、处理文件,或让想法先变成可点可拖可玩的东西。只要能力够用、价格低到可反复试错,很多任务玩法会不同。当单轮修改开销持续降低、试错成本受控,人与模型协同完成项目的体验将顺畅很多。

标签: AI 测评 AI

更多推荐阅读

千问办公发布企业上下文,让Agent真正读懂公司

千问办公发布企业上下文,让Agent真正读懂公司

在大模型忙于刷 Benchmark 时,不能说话的 Jev 意外成为 AI 圈新顶流,反映出大模型应用价值正从“生成什么”延伸到“能否理解复杂信息并做出可靠判断”。在企业办公场景中,员工一句“帮我整理报价”背后可能牵涉客户历史、库存、折扣、审批权限和部门协作。AI 若只会生成文档而不了解业务背景,很难真正进入工作流。企业需要的是能理解业务上下文、知道与谁协作、清楚权限边界的 AI。 千问办公在杭...

2026-09-23
小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

小米开源大模型登顶全球第一,罗福莉长文揭秘RL立功

9月21日,小米MiMo团队发布并全面开源新一代MiMo V2.6系列,包括Pro、Flash、Ultraspeed三款模型。其中MiMo V2.6 Pro在Artificial Analysis智能指数(AA Intelligence Index v4.3)中得分46,超过Kimi K3和Qwen3.8 Max,位列全球开源模型第一、国产模型第一。该榜单上,Fable 5.1得分53,GPT-6...

2026-09-23
华为灵衢重构算力架构,破解Agentic AI互联瓶颈

华为灵衢重构算力架构,破解Agentic AI互联瓶颈

当AI从“生成内容”迈向“自主执行任务”,一场计算架构的深层演进正在发生。Gartner研究显示,到2026年底,40%的企业应用将集成任务特定的AI Agent,超过60%的组织计划在未来两年内落地。 需求爆发正将算力基础设施推向极限。华为常务董事、ICT BG CEO杨超斌在华为全联接大会2026期间指出,Agentic AI时代,集群内不同部件之间的互联与通信能力已成为影响计算系统性能的关...

2026-09-23
Jev与Decitron:决策AI路线之争

Jev与Decitron:决策AI路线之争

最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI,这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。口号是:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”重新成为AI圈热门词。 但这条趋势并非今天才出现。今年6月,中科闻歌发布了通用决策大模型Decitron决策机,尝试将世界模型、多智能体...

2026-09-23
AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

AI创业风向变了:硬件数据赚钱,应用团队开始自训模型

今年,AI 创业的走向比过去更难判断。模型公司不断向应用层下探,To C 产品刚找到的功能可能下一次模型更新就被覆盖;机器人、世界模型等概念迅速升温,越来越多创业公司进入物理世界。当模型本身成为最大变量,什么值得做、什么更容易赚钱、什么样的人更适合创业,都需要重新思考。 YC 在最新播客中拿出过去 12 到 18 个月的批次数据,讨论创业生态变化。几组数字尤其醒目:硬科技公司更多了,从机器人、半...

2026-09-23
AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

AI数据公司Snorkel AI获3.5亿美元融资,估值达35亿美元

Snorkel AI是一家帮助人工智能实验室和企业构建训练数据集及模拟环境的初创公司,近日完成3.5亿美元E轮融资,估值达35亿美元。本轮融资由Insight Partners和S32领投,现有投资者Addition、Lightspeed、Greylock、GV和Wells Fargo也参与其中。这家成立七年的公司估值几乎是17个月前D轮融资时13亿美元估值的三倍,当时融资1亿美元。 Snork...

2026-09-23
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部