770B参数加持,腾讯混元Hy4 Preview实测表现几何?

770B参数加持,腾讯混元Hy4 Preview实测表现几何?

AI 资讯 来源:新闻/公众号 发布时间:2026-08-28 更新于 2026-08-29 预计阅读 3 分钟

770B参数加持,腾讯混元Hy4 Preview实测表现几何?

8月大模型更新潮中,腾讯混元压哨发布了Hy4 Preview。相比四个月前被称作“混元大模型重建第一步”的Hy3,这次新模型总参数量达到770B,激活参数49B,规模近乎翻了两倍多。官方披露,其WorkBuddy任务成功率达90%以上,平均耗时明显缩短。这款被寄予厚望的模型,能否支撑起国模第一梯队的野心?

混元为何被指“慢了”?

在Hy4 Preview发布之前,腾讯AI常被外界质疑“动作慢”。腾讯高级执行副总裁汤道生对此回应,承认算力不足曾拖慢项目进度,但强调Hy4将带来更大突破。事实上,从Hy3到Hy4只隔了四个月,此次升级在参数规模上几乎翻倍:总参数从295B增至770B,激活参数从21B增至49B。这被视作腾讯在大模型赛道加速追赶的明确信号。

实测亮点:从游戏到办公,能力覆盖多元场景

Hy4 Preview的实测表现是外界关注的焦点。在3D月球运输车游戏中,模型展现出不错的物理理解和推理能力——可以自由切换视角,物理效果真实,没有出现明显物理错误,任务完成度相当高。这说明Hy4在空间感知和规则遵循方面具备扎实功底。

在代码与系统修复场景中,Hy4也展示了实用性。它能修复权限错乱、统计口径不一致等常见bug,并新增“异常报销审核”功能,且各流程均做到合规完成。这类能力直接关系到企业级应用的可靠性。

文档与调研环节同样可圈可点。Hy4生成的招聘海报贴合APPSEO风格;深度调研时引用的权威数据准确;基于教育部数据分析博士生趋势,生成的报告可以直接使用。从创意到研究,模型似乎都能胜任。

官方数据与战略调整

腾讯官方给出了一组亮眼数据:Hy3上线一周API调用量即达到上代模型的68倍,而Hy4 Preview的WorkBuddy任务成功率达90%以上,平均耗时进一步缩短。这意味着产品在实际使用中已获得一定认可。

为了巩固这一路线,腾讯把大语言模型和多模态团队合并为基础模型部,统一由姚顺雨负责。这一组织调整表明,腾讯正在强化模型研发的集中度和协同性。从Hy4的表现看,场景、产品与模型结合的路子得到初步验证——模型不再只是炫技,而是落到具体业务中解决实际问题。

不过,即便Hy4 Preview进步明显,腾讯官方也坦然承认,模型距离SOTA(业界最先进水平)仍有差距。换句话说,进入第一梯队并非一役之功。面对激烈的竞争,腾讯混元迈出了坚实一步,但要真正站稳国模第一梯队,还需要在后续迭代中持续证明自己。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部