马斯克交卷Grok 4.7,这次吹牛吹大了

马斯克交卷Grok 4.7,这次吹牛吹大了

AI 资讯 来源:新闻/公众号 发布时间:2026-09-22 更新于 2026-09-22 预计阅读 6 分钟

AI 圈没有假期。从 OpenAI、Anthropic 到 xAI,各家巨头集中抢位。SpaceXAI 正式发布 Grok 4.7,官方定位为目前最强的编程与知识工作模型,已进入 Cursor、Grok Build 和 Grok API,也将通过第三方编程工具、模型路由平台与云服务提供。发布比马斯克最初预告晚了不少,从 7 月下旬开始吹风,一再推迟。

Grok 4.7 使用比 Grok 4.6 更大的全新基础模型,强化学习时间更长,训练任务更难,部分需数小时完成。模型加强长上下文管理和结果核查能力,并针对 Grok Bot 运行环境原生训练。官方公布多项成绩:CursorBench 4.0 中 Grok 4.7 xHigh 得分 46.3%,高于 Grok 4.6 High 的 40.4%;DeepSWE v1.1 从 65.2% 提高到 71.0%;Terminal Bench 4.0 从 20.3% 升至 38.0%;EEBench 从 53.0% 提高到 64.0%;AA Briefcase v1.1 从 1546 分增至 1657 分。

刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了

横向比较,Grok 4.7 优势集中在价格和部分专业任务,综合成绩未全面领先。在 CursorBench 4.0 和 Terminal Bench 4.0 上低于 Fable 5.1 Max;DeepSWE v1.1 略低于 GPT 5.6 Sol Max;但在 Harvey Legal Agent Benchmark 中取得 19.6%,明显高于对比模型。Artificial Analysis 给出 46 分 Intelligence Index,称其让 SpaceXAI 进入全球前四名 AI 实验室,Coding Agent Index 表现超过 GPT 5.6 Sol。

价格成为最直接竞争筹码。API 定价与 Grok 4.6 相同,每百万输入 token 2 美元,每百万输出 token 6 美元。SpaceXAI 还提供输出速度翻倍的快速版本,价格翻倍。官方宣称速度可达同类模型两倍,价格只有一半。

刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了

编程之外,SpaceXAI 开始争夺专业工作,强调文档和演示文稿能力,引用 GDPval 与 AA Briefcase 等评测,试图证明模型可承担律师、护士、金融分析师等部分工作。Box 展示的保险理赔案例中,Grok 4.7 在 Box Agent 中核对一笔 200 万美元索赔、保单与记录,发现 8.2 万美元重复发票和 6.4 万美元遗漏供应商抵扣,还识别出可能令计算结果相差 14.3 万美元的免赔额问题,最终生成带引用的审查报告,保险覆盖和付款决定仍由理赔人员完成。

安全方面,SpaceXAI 表示 Grok 4.7 使用全新安全防护体系,在 LatchBio 生物安全基准中取得 62.4%;HackerBench v0.3 中只有 3.3% 危险双重用途提示通过,同时尽量减少对正常安全研究的误拒。部分网络安全合作伙伴将获邀请制红队能力。

刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了

上线后首批测试集中在网页、3D 场景和可视化编程,口碑两极分化。Eric Zakariasson 展示 Grok 4.6 与 4.7 制作《帝国时代 II》演示项目对比;Ashutosh Shrivastava 让模型根据平面图搭建 Blender 结构并导出为交互式 Three.js 网站;开发者 Diego Cabezas 让 Grok 4.7 xHigh 用 Python 模拟单行道交通灯和随机驶入车辆,称细节最丰富。AI/ML API 用四个 Three.js 太空场景比较,称 Grok 4.7 约花费 0.20 美元,Claude Opus 5 约 2.05 美元,Grok 在其中三个场景用时更短。但开发者 Bhavy 认为其在 3D 和前端任务上低于预期,问题包括物理效果生硬、提示理解不稳定和 token 消耗过快。Harshith 生成 Airbus H145 直升机 Three.js 模型,认为 4.7 逊于 4.6,耗时约 45 分钟。鹈鹕骑自行车 SVG 动画测试中,画面结构和运动关系也受诟病。Salio 认为实际表现高于预期,视觉质量略低于 Astra 但高于 Sol。

整体看,Grok 4.7 在代码评测、专业工作和成本控制方面进步明确,复杂 3D、网页视觉与物理效果不稳定。它更像 SpaceXAI 对开发者市场的集中加码,不是跨代更新,而是补位。其意义在于用更低价格和更快响应争夺开发者反复调用的日常任务。马斯克透露,Grok 4.8 参数规模约 2.5 万亿,采用全新 C++ 训练栈,基础训练后进入强化学习,称会带来明显改进。更远路线图中,Grok 4.9 可能达到 OpenAI Astra 和 Anthropic Fable 级别,Grok 5 被寄托通往 AGI 的希望。

标签: AI 资讯 AI

更多推荐阅读

ICLR 2027投稿量突破6万,超过历年总和

ICLR 2027投稿量突破6万,超过历年总和

今年 ICLR 的摘要提交量达到 6 万+,已超过 ICLR 从 2013 年到 2026 年历年投稿总和。第一届 ICLR 收到 67 篇投稿,ICLR 2026 涨到 19525 篇,2013 至 2026 年十四届会议全部加起来约 5.6 万篇。如今一届 ICLR 2027 就超过了这个数字。 有网友算了一笔账:即使按 20% 录用率,6 万篇也对应 1.2 万篇论文。上一届 ICLR 2...

2026-09-22
清华教授押注机器人ICL:我看到了Scaling Law的信号

清华教授押注机器人ICL:我看到了Scaling Law的信号

本周「十字路口」嘉宾是清华叉院助理教授徐梦迪。她本科读清华车辆工程,后赴Johns Hopkins、CMU,再到Stanford吴佳俊、李飞飞组做博士后,2024年初回国加入清华交叉信息研究院。她的核心命题是机器人的In-Context Learning:让机器人到新环境后,通过一两次交互当场学会新任务,且越学越快。 节目录完第二周,Generalist发布GEN-1.5,只给机器人看3-12秒...

2026-09-22
AI算力不靠堆卡,浪潮信息如何破局?

AI算力不靠堆卡,浪潮信息如何破局?

AI算力的竞争,多年来就一个字——堆。堆卡、堆机柜、堆发电机,似乎计算卡足够多、集群足够大,就能站在食物链顶端。但算力「够不够用」已不再能单靠堆卡解决,它开始分化出越来越多的层面。 第一个问题关于智能上限,即算力能撑起多强的智能。前沿模型的参数规模、上下文长度、推理深度同时变大,Agent可能连续运行几小时甚至几天。模型装不装得下、跑得快不快、长时间稳不稳,都需重新考量。另一个问题是智能规模——...

2026-09-22
多模型分工省额度,还能接入JEV玩红警

多模型分工省额度,还能接入JEV玩红警

上周文章提到 WebCodex 可把网页版额度用起来,随后有读者问:能否让不同模型干不同的活?这其实也是我的需求。主力工具是 Codex,但也买了别家 API,套餐余额分散,Codex 额度仍不够用。此前介绍的 Codex++ 虽能接入第三方模型,但一个任务只能用一个模型。我真正想要的是:把所有模型 API 接到一起,收到任务后先让高智商模型判断难度,再结合各模型能力和余额,把任务拆给不同助手。难...

2026-09-22
实测Qwen3.8-Omni-Flash:全模态Agent价格暴降90%

实测Qwen3.8-Omni-Flash:全模态Agent价格暴降90%

Qwen推出全模态模型Qwen3.8-Omni-Flash,在WildClawBench-MM等30项评测中平均得分比上一代Qwen3.5-Omni-Plus高出26%,音频能力整体超越Gemini 3.8 Flash,音视频能力接近Gemini。API价格大幅下降:相比上一代,每小时音频输入价格下降超98%,每小时音视频联合输入价格下降超93%。现价为每百万Token输入0.8元、输出2.7元,...

2026-09-22
腾讯混元招募外部专家共建AI大模型

腾讯混元招募外部专家共建AI大模型

腾讯推出面向外部行业人才的专家平台“混元智囊团”,Slogan为“聚智为谋,引领未来”。该平台隶属于腾讯混元旗下,通过连接各领域顶尖实战专家与真实AI训练问题,以高质量数据集生产、专业内容编写、知识审核为核心工作,产出的专家资源与专业数据服务于混元大模型持续迭代优化。 简言之,腾讯混元通过接单付费的任务模式,招募金融、法律、医疗、前端设计美学、代码等各领域专业人才,帮忙优化混元大模型能力,为AI...

2026-09-22
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部