Grok 4.7发布:网友实测先拿SpaceX火箭开玩

Grok 4.7发布:网友实测先拿SpaceX火箭开玩

AI 测评 来源:新闻/公众号 发布时间:2026-09-23 更新于 2026-09-23 预计阅读 4 分钟

看来老马也知道,国庆前后基模圈不好混,所以先发先占坑——Grok 4.7来了。

更大的底模、上下文拉到50万Token,重点猛练Coding、Agent以及动辄跑上几个小时的复杂任务。软件工程、电气工程、长时办公、终端和法律任务全面开花。官方评测表中,电气工程基准测试以64%拿下第一,终端操作基准测试从20.3%跃升到38%。价格方面,输入2美元/百万Token,输出6美元/百万Token,加量不加价。

Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起

模型刚发布,网友实测画风就开始不对劲。大家打开Grok 4.7后第一件事居然是发火箭。有网友直接整出“宇宙上天”大戏,还有人让Grok 4.7搓出3D火箭工程,模型、发射架都有,甚至能现场试飞。更有网友把Kimi K3和Grok 4.7一起拖到火箭发射场同题开卷,结果Grok这边多少有点没顶住。

Grok 4.7这波确实是奔着干重活儿来的。从公开评测成绩看,提升主要集中在Coding、Agent和长时任务。xAI官方评测中,软件工程CursorBench4.0从上一代40.4%涨到46.3%,DeepSWE v1.1从65.2%升到71%。电气工程EEBench比上一代提升11个百分点,在表中四款模型里拿下最高分。法律Agent从15.8%涨到19.6%,拉开和GPT-5.6 Sol、Fable 5.1的差距。

Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起

第三方Artificial Analysis榜单中,综合智能指数拿到46分,排在第一梯队之后;Coding Agent Index成绩56分、位列第4,相比Grok 4.6的47分提升一大截。

Grok 4.7还不只是分数上涨,性能成本比也一起提升。xAI给出的CursorBench 4.0成本曲线里,随着单任务预算增加,成绩还能继续往上爬。在大约4~5美元/任务的位置,已能做到约43%,继续加预算还能逼近46%。同等预算下,GPT-5.6 Sol大约还在37%左右,差距有6个百分点上下。这说明这代模型在复杂Coding任务上,多花一点推理预算,确实能更稳定地换回能力增益。

Grok 4.7来了!网友实测先把SpaceX玩坏了,大火箭走起

比发布本身更有节目效果的还得看网友。有人拿Grok 4.6和4.7的开放游戏世界对比,4.6还有点像素小游戏味儿,画面偏平、建模朴素;4.7建模感明显更强,建筑、道路、光影、场景细节都更扎实,已有点正经3D游戏Demo的意思。还有网友让Grok 4.7搓《帝国时代2》,画面细节比上一代更好,但4.6颜色更好些,各有千秋。

难度继续加码,有网友把Grok 4.7扔进Blender,让它现场建金门大桥,全程只花17分钟,近景、远景、特写基本都有,桥体结构和整体画面完成度挺像样。还有人喂了一段SpaceX星舰真实发射视频作参考,让它重新生成定格动画,最终生成视频整体变成类似手绘工程草图/复古定格动画风格。

小游戏这边很快有人来拆台。有网友让Grok 4.7和GPT-6 Astra各写一个弹球游戏,Grok这边开局正常,球也能弹、画面也能跑,但不到10秒球直接卡住不动了。真·大活儿能接,小球难防。

算上去,距离全球基模决战的国庆节已经没几天了。隔壁A社Claude 5.2箭在弦上,谷歌Gemini 4 Pro内测效果刷屏,甚至疑似已披着马甲偷偷混进Arena参加摸底考试。国内厂商也开始陆续往牌桌上加码,国庆前后这几天怎么看都像是又一轮基模集中交卷期。这个时间点发Grok 4.7,怎么不算上上策。

标签: AI 测评 AI

更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联

平头哥真武V900发布:AI算力从单卡走向千卡互联

从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...

2026-09-23
陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产

陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产

不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。 人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型...

2026-09-23
OpenAI新模型24天攻克100+数学难题

OpenAI新模型24天攻克100+数学难题

数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...

2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用

国产AI生图新高度:真假难辨,还能精修到商用

两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...

2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效

剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效

剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...

2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?

AI操控游戏新选择:Jev模型到底能做什么?

Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...

2026-09-23
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部