GPT-6也会看错流程图?视觉编程评测新基准发布

GPT-6也会看错流程图?视觉编程评测新基准发布

AI 资讯 来源:新闻/公众号 发布时间:2026-09-30 更新于 2026-09-30 预计阅读 5 分钟

Coding Agent 正从纯文本世界走向视觉世界。越来越多任务要求 Agent 将流程图、设计稿、3D 草图乃至 PPT 等视觉目标转化为可执行、可编辑的代码,这一能力被称为 Visual Coding。其难点在于:Agent 不仅要保证代码可运行,还需从视觉输入中理解对象、结构、空间关系和语义,并准确编码进程序。

PPT 成为理想测试载体:它由文本、形状、连接线、分组和布局构成,既是可编辑对象集合,又保留视觉结构。视觉相似不等于语义正确——箭头接错节点、漏掉小节点,含义都会改变。

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

Einsia AI 旗下 Navers Lab 发布 PPTBench,任务来自真实科学论文的流程图和架构图,构建 500 个任务,覆盖系统与软件、人工智能、计算机视觉、语言与语音、量子与基础物理、天文、机器人、生物医学等 13 个领域,包含多面板图、层级结构、重复网格、复杂连线和文字密集等布局。任务要求 Agent 用代码将流程图重建为可编辑 PPTX,不能贴图,必须用原生 PowerPoint 对象表达。这要求同时解决三个问题:看懂、写对、交付。

PPTBench 设计了 Agentic Judge。首先通过 Artifact Gate 检查 PPTX 能否正常解析渲染、是否为单页、是否含足够原生可编辑对象、是否存在贴图,无效则 0 分。通过后分三阶段评测:Stage 1 判断流程语义是否正确;Stage 2 检查可读性,排除严重渲染或排版错误;Stage 3 比较整体布局与局部视觉差异,不要求对象表达方式相同,只关注最终视觉结果。

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

研究团队测试 10 个模型、36 种配置,每种完成同一组 500 个任务,每份结果三轮评审,累计 54,000 份评审记录。GPT-6 Astra High 以 77.34 分居首,全部生成有效产物,80.8% 同时通过语义和渲染检查。Kimi K3 High 得 67.80 分,GPT-5.6 Sol Max 和 Qwen 3.8 Max XHigh 分别得 49.28 和 47.69 分。即便最优配置,仍有近两成任务未同时通过两道检查。

在 18000 份结果中,394 份(2.19%)未通过产物检查;11526 份(64.03%)因流程语义错误被拒;剩余 6080 份中 365 份未通过渲染/文字门控,最终 5715 份(31.75%)进入细节评分。细节扣分中,文本与排版占 53.0%,局部图形占 34.3%,布局占 12.8%,失分最多的是文本意外换行。这些问题难以从生成脚本本身看出,只有能进行视觉审查与迭代的模型才能发现并解决。

GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?

提高 reasoning effort 的收益主要体现在门控通过率。GPT-6 Astra 从 Low 到 High,平均分由 59.42 升至 77.34,通过全部门控比例由 63.0% 升至 80.8%,提高 17.8 个百分点;通过门控后的条件细节分仅由 94.32 升至 95.72。但更多思考不保证更高得分:Astra 五档平均分依次为 Low 59.42、Medium 68.16、High 77.34、XHigh 72.60、Max 68.76。从 High 到 Max,门控通过率从 80.8% 降至 71.0%,尽管条件细节分升至 96.85,总分仍下降。这说明思考深度主要让更多产物保留正确流程,细节精度改善有限,把 effort 调到最高档并非可靠默认选择。

模型构建 PPT 的方式与人类不同:人类逐个拼组件,模型一次写出完整生成脚本再根据视觉反馈调整。分析调用轨迹发现,对自己的产物进行视觉检查次数更多的模型往往得分更高。

标签: AI 资讯 AI

更多推荐阅读

AI编程“计划模式”刚成标配,就有人宣布它已死

AI编程“计划模式”刚成标配,就有人宣布它已死

这两天,Hacker News 上一篇《Plan mode is dead》引发关注。作者 Ayman Nadeem 是 YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO。她曾坚信规划是 AI 编程最重要的环节,并围绕这一判断打造桌面编程应用,但几个月后改变了看法。文章触及 AI 编程工具中一条正在松动的产品假设:写代码前,人要先整理出完整计划再交给 Agent。 Nadeem 认...

2026-09-30
齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

齐俊元再创业:Today AI上线,要做更懂你的个人AI助理

9 月 28 日,Manus 发布 2.0 版本,并推出独立的个人 Agent 应用 Cue。每个 Agent 拥有自己的邮箱、电话、钱包和电脑,可以替你接电话、发消息,并在设定预算内付款。 海外 Personal Agent 赛道已相当热闹。Meta 的 Muse 上线 10 天在美国获得 73 万次下载,登上 App Store 免费榜第一。GrokBot 借助 X 的分发能力入场,Town...

2026-09-30
Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Meta新AI应用Muse爆红,小扎口碑逆袭背后逻辑

Personal Agent正在成为下一个风口。 过去三周,Meta发布的个人AI助手Muse成为科技圈最大变量。该应用9月8日上线,仅10天就登顶美国App Store免费应用总榜,第12天全球安装量达280万。9月21日,Meta单日股价上涨11.43%,市值增加近2000亿美元,此后股价稳定在700美元以上。 Muse为每个用户配备独立云端虚拟机,用户通过手机即可浏览网页、操作应用、发邮...

2026-09-30
腾讯秘密开发Personal Agent产品Handy Bot

腾讯秘密开发Personal Agent产品Handy Bot

腾讯正在秘密开发Personal Agent产品“Handy Bot”,并计划推出独立App。目前已在微信端低调上线服务号,简介为“Your Personal AI Agent”。产品仍处内部测试阶段,信息以官方口径为准。 当前行业正热议Personal Agent叙事,Meta刚推向市场的Muse将消费级智能体热度推至新高。传统Chatbot属会话驱动,一问一答,会话结束任务终止;Person...

2026-09-30
视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分不再“变样”!RH Upscale 13组横评综合第一

视频超分长期面临两难:传统方法能拉高分辨率,却难以找回丢失的细节;生成式方法能补细节,却可能导致人物变样、构图偏移,在视频中还会出现闪烁和拖影。画面要更清楚,原内容又不能被改掉。 海马云旗下 RunningHub 发布自研生成式视频超分模型 RH Upscale,目标为“放大而不改内容”,在提升分辨率、恢复纹理的同时,尽量保持人物、构图、色调及运动过程的一致性。在 13 组横向评测中,RH Up...

2026-09-30
320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

320B中国开源黑马杀出,模型自己抓Bug揪出幽灵空格

就在昨天凌晨,一个320B的开源大模型IQuest-Q1发布,权重和blog一并公开。九月赛道竞争激烈,GPT-6 Astra、Fable 5.1、Gemini 3.8 Flash及国产Qwen3.8、GLM-5.3等接连发布。IQuest-Q1由至知创新研究院(IQuest Research)推出,在写代码库、挖安全漏洞和长程复杂任务等硬核评测中与头部模型同台竞技。 研发团队一次强化学习训练中...

2026-09-30
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部