办公实测混元4预览版:谨慎有余,惊喜不足

办公实测混元4预览版:谨慎有余,惊喜不足

AI 资讯 来源:新闻/公众号 发布时间:2026-08-31 更新于 2026-08-31 预计阅读 4 分钟

在Deepseek V4 Pro、Qwen Max 3.8、GLM-5.3等热门旗舰模型集中发布之际,腾讯混元4预览版(Hy4 preview)选择错峰登场,并在Workbuddy平台免费开放两周,混元3则免费至月底。为了一探这款“办公搭子”的真实实力,作者花费68元提前体验,并针对近期互联网热点进行了多场景测试。

官方盲测平均分显示,Hy4 preview为2.99分,Kimi K3为2.94分,GLM-5.3为2.92分。差距虽小,但作者在WorkBuddy中实测了四个办公及学习场景,共发送9句话(含4句“可以,继续”),试图从实际交付质量中寻找答案。

研究型搜索:数据准确,但日期有瑕疵

在第一个场景中,作者要求调研近30天国产大模型动态并制作对比表。Hy4 preview用时14分钟完成,覆盖主流厂商,数据源可信度高。核验发现,其参数数据准确(如Qwen3.8-Max的2.4T、Kimi K3的2.8T),但存在日期瑕疵——Seed 2.1实际发布日为6月23日而非8月10日;DeepSeek“最高涨1100%”的数字正确,但来源链接中并无此数据。相比之下,GLM-5.3漏掉了DeepSeek V4-Pro正式版这一重要信息,而Hy4 preview对不确定信息会标注“存疑”或“未公开”,不强行作答。

数据处理与多轮规划:谨慎是亮点

在数据处理测试中,作者将90行乱格式流水交给Hy4 preview,要求整理为Excel(按月分sheet、含合计行、环比公式、超20%标红),并生成8页深色PPT。Hy4 preview正确识别数据不足,将环比公式留空;PPT图表为自绘透明底图片,并在结论中标注“字段口径不同,建议复核”。这种不硬凑答案的作风,在后续多轮规划测试中再次体现:要求分三期交付播客数据后台,规则中埋有两个坑(叠加上浮计算方式、上限规则),Hy4 preview主动识别出模糊点并确认,最终报价¥62,407,三期交付数据一致。

3D小游戏:手感调优与自我修复

在3D小游戏测试中,作者要求用three.js制作单文件HTML游戏。Hy4 preview交付版本可玩性高,包含0.13秒起跳缓冲、空中操控弱化等手感调优,金币收齐后区分“再来一局”和“重玩本图”。更难得的是,交付前它自动检查40张随机地图,并编写脚本测试60秒。过程中发现无痕模式白屏问题,自行定位并修复,还补充了断网、存储不可用等测试环境。

价格与总结:最便宜档位,但优势有限

价格方面,Hy4 preview为国内主流大模型中最便宜档位。作者总结,Hy4 preview未展现压倒性能力(官方盲测差距仅0.05-0.07),但其在长程任务中对不确定性的处理值得肯定——有信息冲突时摆出冲突,规则存在歧义时停下询问。在办公交付场景中,这种“保险”倾向比追求速度更有价值。

作为一款错峰发布的模型,Hy4 preview没有选择在参数上硬碰硬,而是以谨慎和务实作为卖点。对于追求稳定交付的用户而言,它或许不是最快的,但可能是最让人放心的。未来,这种“宁可存疑也不胡编”的风格,能否成为大模型竞争中的新常态,值得期待。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部