陆川用AI五天复原明代大爆炸,阿里全模态模型兜底影视生产
不用搭景,不用等演员,导演陆川和团队用AI把一场400年前的明代灾难现场做了出来。宫廷、火药库,以及史料中烟云如黑灵芝的大爆炸,按传统影视工业做法往往需要数月时间和千万级投入,这次只用了5天。
人物的脸、皮肤、神态已相当逼真,爆炸的烟尘、碎片、火光也稳稳接住。过去光是一场爆炸戏就要耗费19天。陆川团队把史料文字翻译成现代视觉概念,前后做了约四轮提示词优化,再参考真实爆炸影像校准。阿里视频生成模型对烟尘、碎片等复杂画面的还原准确度已达团队预期的95%以上。AI已不只是给导演吐素材,而是进入完整创作链路,单在视频生成环节,阿里模型贡献度就超过一半。

9月22日云栖大会上,阿里云集中发布模型进展:Qwen3.8-Max开始自己训练自己,Qwen3.8-Flash提前放出下一代架构,Qwen3.8-Omni开辟全新思考分区,Qwen4已开练,Qwen4.5、Qwen5也在路上,参数规模瞄准5万亿至10万亿。图像生成模型Qwen-Image-3.1、音乐生成模型Happy Shrimp 1.1、世界模型HappyOyster 2.0 Preview、语音模型家族Qwen-Audio-3.1、同声传译模型Qwen3.8-LiveTranslate集体亮相,下一代视频生成模型预告11月发布。
阿里这一轮全模态升级,更在意模型能否更快进入场景变成生产力。文字和通用智能有Qwen3.8及Qwen4;图像生成与编辑有Qwen-Image-3.1;视频生成有Wan、Happy Horse系列及11月将发布的下一代视频模型;声音有Qwen-Audio-3.1,音乐有Happy Shrimp 1.1;HappyOyster 2.0 Preview处理世界模型和交互环境;Qwen3.8-Omni-Flash把文字、图片、音频、视频放进统一理解框架;Qwen Intelligence把Agent能力推向手机终端。现实任务天然是混合模态的,模型也很难再一项一项地做。

阿里巴巴ATH事业群副总裁、淘天集团首席科学家郑波提到,文本、图像、视频、声音、空间的能力正加速协同,AI从生成一张图、一段视频、一首音乐,走向理解人的意图,创造完整沉浸式视听体验。阿里判断,如果语言模型是机器的大脑,多模态模型正在成为机器感知世界、创造内容并与物理世界互动的中枢。
从Demo走进生产线,多模态开始接受真考验。第一层是内容生产。Wan3.0已支持单次30秒生成,还能接受文档、表格、网页等结构化输入,曾在Artificial Analysis文生视频和视频编辑两项榜单位列第一。但商业场景里,商品外观、Logo、人物和口播只要有一个漂掉,就很难直接交付。“能不能稳定生产”成为核心考题。据使用者介绍,Wan3.0已接近真实广告拍摄水平。

第二层是进入专业创作。陆川的《历史·现场》把AI带到创作者真正难啃的位置:通用模型容易生成古装剧质感,真正的历史现场反而需要陌生感和严谨史料,也需要模型理解导演意图。阿里巴巴视频生成模型技术负责人表示,未来将与更多导演、行业专家及历史学者合作,为模型引入更全面、更严谨的专业信息。
音乐创作遇到另一套难题。太合音乐集团总裁余灏坦言,AI带来的焦虑并不新鲜,电子合成器、MIDI、DAW都曾引发类似担忧,最后都变成新生产工具。但音乐进入产业后,训练素材、版权、AI翻唱授权、收益分配都绕不过去。余灏特别提到,无授权AI翻唱成本太低,大量版本泛滥会侵蚀原版版权方和艺人价值。小旭音乐创始人卢小旭分享,其工作室做AI歌手需多模型协同:先做人设和视觉锚点,再用音乐模型做歌曲、人声和编曲,接着用视频模型做MV和对口型视频,后面接大模型做评论抓取、分类和运营反馈。他们平均4个项目才能跑出1个成功AI歌手账号,但6个人就能孵化十多个AI歌手IP,一些账号4个月涨粉20万,全网累计播放量突破2亿。
第三层是进入终端和物理世界。Qwen-Audio-3.1-Realtime已进入千问办公、Qoder、千问AI眼镜、随身助理和桌面机器人等,能边听、边想、边说。Qwen Intelligence继续把Agent能力塞进手机,希望完成跨应用复杂任务。HappyOyster 2.0 Preview则要解决环境长期一致、物体运动符合物理规律、用户操作及时反馈等问题。
多模态的下一关,是连续理解和完成任务。演员王珞丹分享,她今年年初开始认真学AIGC做短片,曾抽卡到凌晨4点,早上6点才抽到想要的镜头。更麻烦的是表演,脑子里有具体状态,模型却很难准确呈现;反而给宽泛概念时,模型可能突然给出惊喜。这说明单个镜头已越来越强,但故事一长,人物的状态、情绪和气质很难一直保持。创作者需要的,恰恰是AI能记住前面的内容,一直跟着同一
更多推荐阅读

平头哥真武V900发布:AI算力从单卡走向千卡互联
从真武 V900 到新一代磐久超节点服务器,平头哥八年来布局的 AI 芯片、CPU、scale up 互联、scale out 网络和存储芯片,开始被装进同一套算力系统。9 月 22 日 2026 杭州云栖大会上,平头哥被完整推到主论坛台前,副总裁高慧发表题为「Agentic 时代卓越算力基石」的演讲,发布从真武 V900 芯片到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、...
2026-09-23
OpenAI新模型24天攻克100+数学难题
数学界正被AI迅速逼近。OpenAI一篇重磅博文披露,一款8月28日才开始训练的内部新模型,已攻克100多道世界级数学难题,横跨数学大部分领域,其中包括困扰学界多年的“纳维–斯托克斯”千禧年难题。从开训到9月21日官宣仅24天,进化速度令OpenAI内部数学家都感到意外。 9月8日,OpenAI称该内部模型在88小时内攻克NS千禧年难题,给出NS方程存在性与光滑性问题的证明,并公开166页论文和...
2026-09-23
国产AI生图新高度:真假难辨,还能精修到商用
两张图都是AI生成的,来自商汤科技正式上线的SenseNova U1 Pro,目前可在商汤小浣熊平台使用,API已向企业客户开放。 实测在SenseNova Studio平台进行,模型支持2K起步、最高4K清晰度。第一轮测试将一张生活照重构为纸质风格,随后仅修改人物外套内的黑色圆领T恤为白色,要求严格限定在可见内搭区域。由于T恤、皮带、裤子均为黑色且有胸牌遮挡,边界易混淆,但U1 Pro精准拿捏...
2026-09-23
剪映发布全新AI创作能力:从专业剪辑到普通用户全面提效
剪映在2026 AI新创作发布会上发布全新AI能力,覆盖PC专业版与App端,分别聚焦“提效”与“省心”。 PC专业版推出剪映Hub,一站式AI创作平台,将AI创作与多轨道剪辑连接,让脚本、素材与创作上下文在同一项目中延续,减少跨工具切换的断点与重复操作。剪映助手Agent介入专业创作流程,承担素材整理、粗剪、包装等工作,可根据创作目标规划任务、串联模型工具并自动运行,用户也可自定义工作流,沉淀...
2026-09-23
AI操控游戏新选择:Jev模型到底能做什么?
Jev 是 TypeSafe AI 推出的决策模型,创始人 Diogo Almeida 曾在 OpenAI 参与指令跟随与对话研究。TypeSafe 开发两年后发布该系统,官方称为 System One Models。其使用方式是把当前情况和问题输入,模型返回程序可直接使用的结果,本质上是分类模型,接口主要有三种类型。 在游戏场景中,可每一步询问它:当前血量、怪物和金币位置、出口位置,目标是拿金...
2026-09-23
阿里云栖大会:吴泳铭为何用经济学讲AI未来
9月22日,杭州云栖大会,阿里巴巴集团CEO吴泳铭发表开场主旨演讲。过去几年,云栖大会演讲常被视为技术风向标,但这次吴泳铭花了很多时间讲工业革命、电和经济学,重心不在AI会变成什么样,而在AI会让世界变成什么样。他提出核心观点:上一次类似变化是工业革命把动力变成规模化商品,人类发明蒸汽机、内燃机和电,并围绕它们建立现代产业,这一次轮到思考。当一个CEO用经济学语言描述未来,说明他思考的已不仅是产品...
2026-09-23