智象新模型实测:视频生成开始理解真实世界
近几月,AI视频生成赛道持续升温。7月31日,Seedance 2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;9月,智象HiDream-O1-Video-1.0(简称HiDream V1)发布并冲上权威榜单全球前四。以字节Seedance、MiniMax H3、阿里Wan 3.0和智象HiDream V1为代表的中国模型,开始在全球主流榜单头部形成集群,从“单点领先”转向“多家并进”。智象作为创业公司进入这一区间,意味着头部牌桌上开始出现新玩家。

行业竞争重点也在变化。除画质、时长和人物一致性外,模型对复杂运动、物理规律等真实世界的理解,正成为新的竞争维度。9月15日,智象发布原生全模态音视频生成模型HiDream V1,其图生视频能力在Artificial Analysis排名第4,在Arena.ai图生视频模型榜单中排名第8,双榜前十。随着HiDream V1加入,智象围绕世界模型路线构建的模型矩阵补上了视频拼图,完成闭环。

HiDream V1的解法是,在生成前先通过多模态意图理解模块分析用户需求,再调用多模态理解模型进行结构化规划,覆盖人物、动作、镜头、光影、台词、声音等关键信息,将自然语言需求拆解成可执行分镜信息后,再进入联合生成。时长也是规划的一部分,模型根据内容自行规划时长,原生支持5—20秒任意时长生成,不再只是固定参数。在此基础上,1080p高保真输出保障单镜头画质。

智东西用三个场景实测。在意图理解测试中,语音输入简单提示词并附中途切入的参考图,HiDream V1精确还原人与狗动向,并通过手臂搭腿、起身前倾和打晃等细节透露疲惫姿态。在时长测试中,面对撑不住十秒情节的短提示词,模型未强行凑时长,视频仅7秒,鸟叫、猫咪抬头和懒洋洋姿态保持良好。在音画一致性测试中,模型将残缺歌词补全,“低音轰进胸口”清楚对应口型。
视频模型要跨过的分水岭,是让画面里的运动符合真实世界因果。HiDream V1在生成与叙事规划中强化了对物理规律的建模,包括重力、碰撞、惯性、光影衰减和空间连续等。智东西进行三次测试:拧螺丝场景中,螺丝刀与螺丝位置对应,螺丝逐渐进入木板并完成拧紧;NBA三分绝杀场景中,球员动作流畅,肌肉线条、篮球飞行轨迹和旋转符合物理规律,仅最后出现轻微位置偏移;百米飞人大战场景中,8名运动员起跑、拉开差距到并肩冲刺,姿态、摆臂和腿部动作连贯,无明显穿模,脚步声与步频对应。
支撑这些能力的是智象“先规划、后联合生成、再以多模态Reward对齐”的技术思路。后训练阶段采用Diffusion RL技术,并设计多模态Reward模型。背后有DMSampler、DiffusionCompass、EvoID三篇论文,分别收录于2026年ICML、ECCV、CVPR三大顶会。智象联合创始人兼CTO表示,视频生成的代际进化不仅在于像素和时长,更在于模型是否真正理解创作者意图和真实世界物理规律。HiDream V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从“看得清、动得顺”迈向“听得懂、说得准、演得连贯”。
HiDream V1的意义不只是新增视频模型,更在于补上原生全模态世界模型矩阵中的Video一环。围绕统一底座,智象已形成图像、视频、3D、具身四个模型方向。此前,HiDream-O1-Image商用版1.5在Artificial Analysis文生图榜取得中国第一、全球第三;HiDream-O1-Video在两项图生视频榜单分列第4与第8;HiDream-O1-World在交互式世界模型基准中也有布局。
更多推荐阅读

Anthropic首曝:3万AI智能体正自我迭代
Anthropic首次公开内部三大AI研发指标,揭示递归自我改进(RSI)正在其实验室真实上演。 第一项指标关于AI参与研发的程度。Anthropic依据Epoch AI六级自动化标准,对内部研发流水线进行评估。2026年7月,其随机抽取模型研发部门20%员工,用Claude研究智能体分析其Slack记录和内部文档,梳理出15000项研发任务、542个任务节点。截至2026年8月,Claude尚...
2026-09-18
OpenAI总裁证实另一千禧年难题获重大进展
上周,OpenAI宣布在纳维尔-斯托克斯方程相关问题上取得突破,引发全球关注。随后,联合创始人兼总裁Greg Brockman公开表示,在另一个千禧年大奖难题上也取得了重大进展。外界传闻称,OpenAI可能已实质性解决全部六个未解千禧年难题中的两道,并猜测在即将到来的开发者大会上,奥特曼与Brockman可能掏出“终极底牌”。 目前未解的千禧年难题包括:P与NP问题、黎曼猜想、杨-米尔斯规范场与...
2026-09-18
OPPO姜昱辰:大模型差距在缩小,AI手机差距才刚拉开
OPPO ColorOS 智慧产品研发总监姜昱辰给 AI 手机下的定义是:「以意图驱动的手机就是 AI 手机。用户说一句话,手机就能把事情办了,不需要再打开 APP、反复点击。」按此标准,包括 OPPO 自家产品在内,目前没有一台手机可称为 AI 手机。但做出这样的手机正是 OPPO 的目标。 OPPO 的答案是不与大模型公司争云端模型,把核心能力压在端侧,将手机做成真正的 Personal A...
2026-09-18
智谱10万国产卡两周让GLM优化自身推理系统
两周时间,10万颗国产AI加速器,一个开始优化自己的模型。智谱GLM首席科学家唐杰在X平台分享了一项关于GLM-5.3-Flash推理系统优化的研究。他透露,从GLM-5.3-Flash首次运行在国产AI加速器上,到完成全部生产流量承载,仅用了两周时间,系统端到端吞吐能力提升了3.2倍。最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由GLM-5.3驱动的Infra Age...
2026-09-18
Manus拆分后首轮融资33亿 估值翻倍至268亿
据彭博消息,Manus正计划完成约5亿美元融资,估值有望达40亿美元,较此前20亿美元估值翻倍。知情人士称交易已接近完成,但仍处早期阶段,条款和投资者名单可能变化。这是Manus从Meta分拆后的首笔融资,若谈成将成为中国通用AI智能体赛道估值最高的公司。现有投资方包括腾讯、HSG和真格基金,未来可能效仿月之暗面寻求赴港上市。 Manus于2025年初在武汉和海淀成立,做AI智能体产品,邀请码一...
2026-09-17
Gemini 4 Pro疑伪装现身盲测,2M上下文泄露
今天上午,有用户在Code Arena的battle模式中抽到标着gemini-3.8-flash的模型,让其用HTML画一只鹈鹕骑自行车的2D SVG动画。结果鹈鹕有完整踩踏动作,背景会切换场景,嘴里还叼着一条鱼。将“鹈鹕”换成“提壶”后,生成的开水壶精骑自行车同样惊艳:壶盖冒热气,车后座绑着茶叶包,炉火温度和踏频都做成了可调控件。而正常3.8 Flash跑同一提示词,只出来一只方块拼成的静态鸟...
2026-09-17