国产开源多模态决策模型Intern-Decision发布,速度超Jev两到三倍

国产开源多模态决策模型Intern-Decision发布,速度超Jev两到三倍

AI 资讯 来源:新闻/公众号 发布时间:2026-09-29 更新于 2026-09-29 预计阅读 6 分钟

对于现有AI智能体,能否在有限候选方案里快速、准确地给出决策,直接影响任务完成情况。TypeSafe的Jev让模型面对给定选项直接给出结构化决策,把“快速选择”变成可被程序调用的能力。但要让这种“直觉”进入真实场景,模型还必须看懂图像和不断变化的界面。

上海人工智能实验室研究团队构建了多模态决策SOTA模型Intern-Decision,性能超越Jev和目前所有相关开源模型,探索结合视觉理解与指令遵循,让模型快速作出判断,同时兼顾决策效果。

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

Intern-Decision将决策建模为“自回归式掩码语言任务”,充分利用现有LLM的Next-Token Prediction能力,达到一步Prefilling即可获得全部问题结果。团队还构建了面向实时结构化决策的数据体系,从决策场景中抽象出多类结构化任务,定向构造高难度决策样本并融合公开语料,使模型既能学习通用快速分类,也能学习真实业务和复杂文本中的决策边界。

在RTX4090上的推理速度测试显示,Intern-Decision相较Jev有2-3倍效率提升,4B模型端到端推理时延可缩短至每query 45ms以下,0.8B和2B推理效率基本一致,可达每秒约30次推理,几乎可在绝大多数场景实现“实时”决策。

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

大模型在决策任务中,输出正确选项只是第一步。对于医疗判断、风险控制、智能客服和安全审核等场景,系统还需知道自身有多大把握,能否在不确定时给出合理概率分布。Intern-Decision对模型进行了温度校准,整体Brier从0.628降至0.550,ECE从0.213降至0.089。在JevBench-hard上的可靠性分析显示,校准前模型在高置信度区域存在明显偏差,校准后置信度与真实准确率之间的偏差明显减小。团队还构建了专用选项概率分布评测集,覆盖直接随机性、混合分布、条件概率、观测偏差、概率谜题和序列过程六类场景,并为每道题提供精确参考分布。结果显示,校准后整体Brier和ECE均优于Jev的0.595/0.130。以“三门问题”为例,校准后的概率分布更接近真实值。

在Jevbench-hard的111道题上,Intern-Decision独立作答准确率达73.87%(82/111)。这款4B模型部署在单张RTX4090上,平均每次判断仅需44.16ms,完成整套任务只需4.90秒。如果根据置信度将拿不准的42道题交给Atria-Dawn-Preview处理,最终准确率升至87.39%(97/111),整套任务总耗时估算为140.16秒。相比之下,全部交给Atria的准确率为89.19%(99/111),实测总耗时300.03秒。接管方案仅少答对两道题,却将总耗时缩短约53.3%。这正是大小模型协作的价值:追求速度时让小模型快速作答;需要更高精度时,通过置信度把不确定问题交给大模型,用额外时间换取更可靠判断。

比Jev快2-3倍的国产开源模型来了:Intern-Decision拿下多模态决策SOTA

游戏任务要求模型将视觉感知与动作选择结合。Intern-Decision可直接读取游戏画面并做出相关动作,例如在贪吃蛇中寻找食物、避开自身,在接水果时区分水果与炸弹,在超级马里奥中选择移动和跳跃,并在两个第一人称游戏任务中寻找生命补给或射击来袭敌人。五个演示覆盖二维网格、横版平台和第一人称三维场景,展示了将画面理解转化为连续交互行为的能力。团队还发现模型在游戏中出现探索性行为,比如Doom的Health Gathering场景中,角色触墙后会晃动镜头尝试发现新目标。

验证码任务要求模型将视觉感知、指令理解与交互决策结合。Intern-Decision直接读取界面截图,根据自然语言描述寻找目标,并通过离散鼠标移动与点击完成任务。四个演示记录了模型自主完成任务的完整成功轨迹,全程无人工接管或纠偏。

网页操作要求模型在持续变化的界面中反复判断下一步动作。这里采用大小模型协同方式:大模型负责理解整体目标、拆解阶段任务并结合跨页面信息提供指导;Intern-Decision负责高频局部决策,根据当前页面在点击、滚动、返回和结束等候选动作中快速选择。每次操作后系统重新读取页面状态,再进入下一轮判断。三个Demo展示了该协作方式在真实公开网页中的应用:Hugging Face上从官方Atria模型集合中找到标准checkpoint并核对架构与默认推理配置;GitHub上从搜索结果识别Atria官方仓库,进入Issues并定位包含422与502/503异常的API可靠性报告;PyTorch上沿官方文档查找scaled_dot_product_attention的dropout使用风险,并追踪到对应版本源码实现。这些任务覆盖模型集成检查、API问题排查和技术资料核验等常见工作。

团队本次开源0.8B、2B和4B三款多模态决策模型,目前Intern-Decision系列模型已在Hugging Face开源,代码和样例存放在GitHub。

标签: AI 资讯 AI

更多推荐阅读

Sonnet 5.5发布:速度提升30%,成本暴降,性能反超Opus

Sonnet 5.5发布:速度提升30%,成本暴降,性能反超Opus

就在OpenAI年度开发者大会开幕前一天,Anthropic发布Claude Sonnet 5.5。作为Opus 5.5的搭档,它定位为最快、最省钱、最懂日常工作的全能助手。相比Sonnet 5,运行速度快30%,完成相同任务成本最高降低30%,标价仅为Opus 5.5的一半,性能却几乎追平。 在智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分70.6%,约为原来的...

2026-09-29
GPT-6一张图纸造出3295个零件

GPT-6一张图纸造出3295个零件

GPT-6 Astra发布后,OpenAI改变了以往靠跑分榜单展示能力的方式,转而让开发者直接“交作业”。开发者Tom Krcha将一张旧蒸汽机车图纸交给Astra,让它在Blender中重建。几分钟后,Blender里出现3295个可编辑独立对象,包括锅炉、连杆、车轮、铆钉,每个都能单独选中和修改。Krcha强调,Astra并非在Blender里点鼠标操作,而是全靠写Python脚本把零件逐个“...

2026-09-29
高通CEO安蒙谈智能体时代与中国速度

高通CEO安蒙谈智能体时代与中国速度

美国当地时间9月22日-24日,高通技术公司举办的2026骁龙峰会在夏威夷举行,首次同时发布第六代骁龙8超级至尊版与第六代骁龙8至尊版两款旗舰移动平台。“智能体AI”贯穿三天峰会,高通总裁兼CEO安蒙强调:“我们正从‘APP驱动’迈向意图驱动的‘智能体’时代。” 大会另一重要信号是端侧智能体落地:高通联合阶跃星辰、无量火、江波龙,将300亿参数的MoE大模型完整部署进手机端侧,让智能体以如此大的...

2026-09-29
88%企业用AI,仅6%真赚钱,阿里瓴羊推AI员工扛KPI

88%企业用AI,仅6%真赚钱,阿里瓴羊推AI员工扛KPI

2025年,全球88%的受访企业已在至少一个业务职能中常态化使用AI,但能从中获得显著价值、贡献至少5%息税前利润的“AI高绩效企业”仅占6%。大量AI进入公司,真正帮企业赚钱的却不多。员工用AI把200字总结扩成几十页PPT,老板又用AI压回200字,Token消耗不少,工时省了一些,但企业收入、转化和留存没有改变。 2026云栖大会上,阿里云智能集团瓴羊CEO朋新宇指出,AI可以从效率革命起...

2026-09-29
Sharpa发布首款人形机器人D01,三款新品打通具身智能操作闭环

Sharpa发布首款人形机器人D01,三款新品打通具身智能操作闭环

一双会盘核桃、能做冰淇淋的灵巧手,让Sharpa为人熟知。这家禾赛科技创始团队再出发的具身智能公司,最鲜明的标签是高自由度触觉灵巧手。在正在进行的IROS上,Sharpa推出首款全自研通用人形机器人D01、新一代灵巧手W02及外骨骼数据手套AE01,一次性覆盖手、身体和数据入口。 D01定位一体式触觉感知灵巧操作机器人,手臂载荷自重比接近1:1,最大末端执行器速度超10.5m/s,通信频率100...

2026-09-29
华为联合团队夺SAT 2026大赛AI赛道冠军

华为联合团队夺SAT 2026大赛AI赛道冠军

近期,约束求解与形式化领域国际顶级赛事 SAT Competition 2026 落幕。由华为诺亚方舟实验室、华为云天筹 AI 求解器团队和华中科技大学 John Hopcroft 计算中心组成的联合团队,获得并行 AI 赛道 SAT 组冠军。 SAT 问题被誉为计算复杂性理论中的“珠穆朗玛峰”,从硬件验证、软件测试到密码学分析与 AI 规划,SAT 求解器已成为自动驾驶、EDA 芯片设计等产业...

2026-09-29
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部