AI报告读着累?新指标用隐喻率量化可读性

AI报告读着累?新指标用隐喻率量化可读性

AI 资讯 来源:新闻/公众号 发布时间:2026-09-05 更新于 2026-09-05 预计阅读 4 分钟

AI写的研究报告越来越长,却越来越难读?Manus团队近日提出一个新思路:用“隐喻率”来量化报告的可读性。这一指标源于即刻用户@胡迪Hoodie的观察——他在Manus团队从事评测工作,其Research Bench项目旨在从难以验证的复杂工作中,找到能反映用户关键体验的信号。

胡迪注意到,像Claude Fable-5这样的模型智商极高,但写作时比喻密集,读起来颇为费力。他由此提出,可以用模型使用比喻的频率——即“隐喻率”——来衡量Agent调研报告的可读性。

这一讨论的背景,是LLM在Coding能力提升的同时,文本能力似乎有所退步。在Manus中,深度研究报告是基础场景,如何构建有效指标衡量报告质量,成为团队必须面对的课题。报告的好坏取决于两点:包含哪些信息,以及信息如何组织。Manus为此实践了两个指标:“信息量”与“隐喻率”。其构建原则是有效——直接反映模型特点,以及可靠——可量化、支持自动化评测。

“信息量”指标针对的是2025年AI研究产品普遍“写得长”的优化目标。用户的核心需求是高效获取足量信息,而非冗长文本。该指标用LLM抽取报告中的事实点或数据点数目。例如,同一主题下,模型A的报告可抽出7个事实点,如“iPod于2001年发布”“容量5GB”;而模型B字数相近,却只能抽出2个事实点,其余都是“里程碑事件”之类的修饰语。

Research Bench覆盖了9个主流模型、36个研究题目,采用Agent as a Judge方法进行评测。结果显示,GPT旗舰模型在“信息量”上落后于Claude系列,但在“文章详实度”上得分更高,表明其信息密度更低。进一步分析发现,GPT在写中间过程笔记时倾向做完整总结,导致信息损失大于Claude的bullet points记录。通过Prompt规范后,GPT报告的信息量得到了提升。

“隐喻率”指标则旨在量化文风。直接让LLM打分不够可靠,缺乏解释性。隐喻作为一种“语言函数”会带来信息损失,高密度隐喻会降低易读性。该指标计算每百句话中隐喻表达的次数,同样采用Agent as a Judge,处理9个模型各36篇中英文报告。Prompt会排除无感隐喻和术语性比喻,并要求输出字面替换以校验质量。

测试结果显示,GPT 5.6系列的隐喻使用更克制;Claude Fable-5的隐喻率最高,偏好身体和有机体表达;Opus-5较低且更学术;Gemini-3.7-flash倾向宏大词汇;Grok-4.6则多用商业竞争隐喻。不过,隐喻率仅是衡量可读性的一个视角,其低并不绝对意味着文章更易读。

从“信息量”到“隐喻率”,Manus团队试图在AI文本能力退步的隐忧中,为报告质量找到可量化的标尺。这两个指标未必完美,却提示了一个方向:当AI生成的内容越来越长,如何让它们真正“好读”,或许比堆砌更多事实更为关键。

标签: AI 资讯 AI

更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速

世界模型专家刘宇加盟理想,机器人基座模型研发提速

理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。

2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启

AI办公赛道巨头混战,Agent创业窗口反而开启

2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。

2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%

AI科学家K Pro上岗,全球最大药企研发提速70%

Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。

2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿

Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。

2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明

AI攻克费马大定理:Claude 11天写出1300万行证明

Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。

2026-09-05
22分钟从照片到可漫游三维场景,GPT-6实测惊艳

22分钟从照片到可漫游三维场景,GPT-6实测惊艳

实测GPT-6:上传白宫照片,22分钟生成可自由浏览的三维场景,支持WASD漫游与日光调节;还能制作动画、游戏和文章,展现强大的自主完成能力。

2026-09-05
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部