国产多模态大模型开源:5.5B激活参数,免费可用

国产多模态大模型开源:5.5B激活参数,免费可用

AI 资讯 来源:新闻/公众号 发布时间:2026-09-10 更新于 2026-09-10 预计阅读 5 分钟

智东西9月9日报道,蚂蚁百灵正式开源其首个原生多模态大模型Ling-3.0-flash-VL。该模型为1240亿总参数的MoE模型,单次推理激活5.5亿参数,原生支持图像、文本和视频输入,上下文窗口达256K Tokens。蚂蚁同步开放BF16和FP8版本,开发者可在Hugging Face和ModelScope下载权重,FP4和INT4版本也将在近期上线。

5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用

该模型基于Ling-3.0-flash拓展而来,加入视觉编码器,并将视觉能力用于网页编程、GUI操作、长视频处理和医疗报告理解等任务。9月5日,Ant Ling已在X上公布该模型,展示视觉感知、STEM推理、文档理解、多模态Agent、前端编程等测试成绩。海外本地AI推理开源项目Atomic Chat已放出运行演示,输入Flappy Bird游戏截图后,模型短时间内完成游戏页面和基础交互的复刻。有海外开发者评价称,又一家中国实验室开放模型权重,直接提供BF16和FP8,“是一次相当扎实的开放”。也有开发者追问FP8量化是否覆盖完整视觉编码器。

5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用

测试方面,在Artificial Analysis Intelligence Index v4.1.1中,新模型获42分,比纯文本版Ling-3.0-flash高4分。在Image-to-WebDev Arena中,以匿名代号“linthium-931h”参测,成绩1441分,略高于GPT-5.4的1440分。不过,与前沿闭源模型仍有差距,Claude Fable 5.1为66分,Claude Opus 5为63分。多模态专项测试中,CountBench视觉感知97.33分,MMMU-Pro 79.00分,OmniDocBench1.5文档理解91.35分,WebVoyager网页操作90.83分,医疗报告理解测试AntBench-Medical两项指标分别为0.96和0.93。MathVision测试为84.87分,低于Qwen3.8-27B的87.40分;CharXiv_RQ为81.30分,也低于Qwen3.8-27B的83.70分。

5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用

Ling-3.0-flash-VL延续MoE技术路线,语言主干采用42层混合架构,KDA与Gated MLA以5:1比例交替排列;视觉部分加入任意分辨率视觉编码器和VideoRoPE。模型引入“视觉反馈”机制:视觉理解→代码实现→浏览器渲染→查看结果→继续修改。在前端开发场景中,用户输入网页截图后,模型可识别布局、字体、颜色和组件关系并生成代码,运行后查看渲染效果并与参考图比较,反复修改。该机制也用于GUI Agent,执行点击、输入、滚动等操作后重新读取页面,根据结果决定下一步动作。蚂蚁还计划开放与前端复刻配套的Design Skill。

长视频场景中,模型可利用256K上下文保留视频内容及操作信息,官方案例展示了体育比赛高光剪辑。实时视觉能力已用于灵光App,用户打开摄像头后可识别动植物、食材、建筑、汽车及外语标识并连续追问。医疗场景中,模型可读取多页多份报告,提取指标和参考区间,关联不同时期资料,重新核对数据后输出结构化结果。蚂蚁强调,该功能仅用于辅助理解医疗信息,不能代替专业医生诊断。

目前,Ling-3.0-flash-VL在长尾场景感知推理、长链路Agent执行及长程全栈编程等任务上与最佳模型仍有差距,真实环境下的异常恢复和结果稳定性也需继续提高。近一个月,国产大模型厂商接连开放多模态模型权重:8月14日阿里千问开源Qwen3.8-27B;8月31日DeepSeek开源DeepSeek-V4-Flash-Vision-Exp。随着权重开放,这些能力将从官方测试和Demo进入开发者实际验证阶段。

标签: AI 资讯 AI

更多推荐阅读

刘慈欣坐镇AI科幻大赛,百万大奖寻找完整故事

刘慈欣坐镇AI科幻大赛,百万大奖寻找完整故事

初中时看《科幻世界》很痴迷,从《三体》到《逃出母宇宙》,想象力第一次被插上跨越星河的翅膀。这几年我试着用AI把脑海中的场景画出来、做成视频,也收获了不少关注。看到RunningHub与第十七届华语科幻星云奖联合发起全球AIGC长片创作大赛,内心某个角落被激活了。大赛9月8日启动报名,10月9日先导片提交截止,11月3日正式作品截止,约两个月创作时间。这是我一定要参与,也强力推荐给朋友的比赛。 奖...

2026-09-10
中国首部AI长剧导演:三年后99%影视内容都将用上AIGC

中国首部AI长剧导演:三年后99%影视内容都将用上AIGC

9月6日晚,导演李东珅在北京朝阳一文创园接受采访。他是国内首部AI长剧《后西游记》的导演。该剧共30集、每集约40分钟,画面和人物演绎均由AIGC完成,2026年8月31日在芒果TV上线并登陆湖南卫视黄金档。芒果超媒连续两个交易日“20CM”涨停,9月1日报收20.38元,两日市值增加约116.5亿元。 李东珅曾拍过《河西走廊》《中国》等纪录片,自称“国内拍历史类纪录片已是天花板”,但去年他感到...

2026-09-10
AI不需要K8s?他们放弃数百万营收转向AI Infra

AI不需要K8s?他们放弃数百万营收转向AI Infra

“做事情就得边开车边修轮子,你得往正确的方向走,不能等坐上保时捷了才出发。” 四年前,法国一场 CNCF 大会上,主持人问大模型创业者:“Kubernetes 能为 AI 带来什么?”对方脱口而出:“AI 不需要 K8s。”随即又找补说也用了一点点 K8s 管底层集群。台下坐着的梁胜与秦小康对此格外敏感:写 Python 的大模型开发者关注权重、上下文和推理延迟,而非 Pod 编排与容器调度。 ...

2026-09-10
GPT-4o核心研究员连辞OpenAI和Anthropic

GPT-4o核心研究员连辞OpenAI和Anthropic

9日凌晨,Jacob Coxon在X上宣布从Anthropic辞职。他过去三年在OpenAI和Anthropic做预训练研究,是GPT-4o核心贡献者。今年年初,他因Anthropic的安全声誉从OpenAI跳槽过去,几个月后却连整个AI行业一起退出。他将当前AI竞赛称为“一场傲慢的赌博”,认为不该从私人公司的Slack里发动。 Coxon认为,两家公司问题不同:OpenAI很多人没有真正内化文...

2026-09-10
AI打破助听器30年暴利,深圳公司把价格打到十分之一

AI打破助听器30年暴利,深圳公司把价格打到十分之一

一个塞在耳朵里的小东西,卖到十万一副。全球近九成助听器市场份额被五家外资公司把持:索诺瓦(峰力)、Demant(奥迪康)、WS听力、瑞声达、斯达克。旗舰产品在中国线下卖到七至十万一对,美国也要三四万。过去二十年,市场格局几乎少有波动。 垄断的根源是一道技术难题:音频分离。在嘈杂环境中锁定人声并不容易,谁能解好这道题,谁就有资格定高价。五家公司用芯片和算法做到七八十分,再用遍布全球的验配门店,把市...

2026-09-10
豆包工作更新实测:浏览器录制回放与本地Office编辑上线

豆包工作更新实测:浏览器录制回放与本地Office编辑上线

AI圈现在卷得最凶的地方,是你的电脑桌面。OpenAI不断强化桌面端应用,Anthropic相继推出Claude Code和Claude Cowork。字节这边也没闲着,豆包工作又上了一波新:浏览器录制与回放、本地Office编辑、任务执行环境自由切换。 用过一圈AI办公工具的人,多少都有同一种体感:AI会的越来越多,自己却没轻松多少。原因在于,AI虽然已经坐进了你的桌面,但它还是不知道你每天都...

2026-09-10
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部