Claude Opus 5.5视频真相:AI写程序逐帧画出来
2026年9月22日,Anthropic发布Claude Opus 5.5。随后一周,社交媒体出现大量“一句话做出来”的动画视频,包括动效作品集、科普短片、动态设计和一支两分半钟的MV。有人误以为Claude有了视频模型,或以为AI写几行代码视频就会自动生成,这两种理解都不准确。
Opus 5.5能读文字、图片和文件,但看不了视频,输出也只有文字。这些视频全是它写的程序画出来的:程序规定每一帧的样子,浏览器或渲染软件按程序逐帧绘制,再拼成MP4。Anthropic发布文章也未提及视频能力,重点讲的是写代码、操作电脑和知识工作。做这些视频时,Opus 5.5身兼导演和程序员两个角色。

制作流程分五步:规划、画面、动作、声音、拍摄与合成。
第一步规划。Opus 5.5先写脚本,再拆成分镜,明确每个镜头画什么、持续多久、配什么话。公开源码的MV《I'm Upping My P(doom)》时长156.6秒,项目名PDoomVideo。作者只指定了一个角色形象,要求每句歌词配有趣画面和转场,其余全部由模型生成。模型第一轮后自己写了分镜规范STORYBOARD.md,规定固定角色设计、配色变化、每个镜头必须有东西在动、画面不放文字、表情渐变、镜头切换由动作带出,并按章节派出多个子智能体,各写一个JavaScript文件负责时间轴一段。视频生成两轮,所谓“一句话一次成型”指用户只发一句话,模型内部完成规划、分工和返工。Anthropic提到有测试者让它无人值守连续干了18个多小时。

第二步画面。形状、颜色、角色都由代码描述。常见写法是网页:文字色块用HTML、CSS排版,图标角色用SVG绘制。3D场景常用three.js。那支MV用p5.js加水彩笔刷库,有手绘感。也有不经过网页的路线,如用Manim做数学动画、用Blender当Python库建模贴图。需要照片级素材时可先用图像模型生成图片再放进网页。
第三步动作。代码里有时间表:第几秒、哪个东西、怎么动。常见两种写法:GSAP,每行一条指令,时间轴可暂停、可跳到任意时间点;Remotion,每一帧都是帧号的函数。两者效果相同:给定时间点,画面唯一确定。

第四步声音。带旁白的视频一般先做配音再让画面对齐。Claude写旁白稿,交给ElevenLabs等文字转语音服务,其带时间戳接口返回每个字符的开始和结束时间;现成录音则用Whisper反推词时间。配音成为全片时钟,音效和音乐也放在同一时钟上。音效来源包括音效库、AI音效或音乐模型(如Suno)、代码合成。MV则反过来,歌曲本身就是时钟。
第五步拍摄与合成。用无头浏览器(通常是Chrome,由Puppeteer操作)逐帧截图,从不按播放键。以HyperFrames为例,渲染器先跳到第0秒截图,再跳到第1/30秒截第二张,10秒30帧视频截300张。那支MV用每秒24帧,156.6秒约3760帧。不直接录屏是因为浏览器异步加载字体、图片,动画跟屏幕刷新走,卡顿会掉帧,同一代码在不同电脑上结果可能不同。解决办法是用特制Chrome让排版、绘制、截图一次完成;嵌入视频素材先用FFmpeg拆成图片,拍到哪帧换哪张。代码有三条禁令:不能读取当前时间,不能用无固定种子的随机数,渲染时不能联网。这样每帧只取决于时间点,同一代码每次渲染结果完全相同,几千帧还可分给多个浏览器进程同时渲染。收尾交给FFmpeg合成。
更多推荐阅读

2.8万亿参数大模型竞速:中美团队同步突破推理效率瓶颈
2.8万亿参数的大模型如何跑快,成为海内外团队共同攻关的方向。Kimi K3以2.8万亿总参数、104B激活参数刷新开源模型性能上限,但普通AI服务器难以承载,官方推荐64卡甚至更大规模,未经优化的超节点初始性能可能仅约10 tokens/s。 9月21日,浪潮信息发布元脑SD200 Ultra超节点AI服务器,紧耦合128芯本土AI芯片,单机承载Kimi K3,Token生成时延首破5.85毫...
2026-10-01
国产世界模型首出海,Momenta智驾开进欧洲街头
9月24日,Momenta与神龙科技达成战略合作,双方将基于Momenta的R7世界模型,共同开发高阶智能辅助驾驶系统,并搭载在标致、Jeep的新量产车型上,覆盖中国、欧洲及全球其他市场。这次合作的终点不是中国市场的一款车型,也不是某个海外试水项目,而是把已经在中国大规模跑起来的智驾,直接装进国际品牌的全球车型。 Momenta此前已有120多款搭载智驾的车型,也有自主品牌、合资品牌的量产经验,...
2026-10-01
AI视频总抽卡?TapNow上线3D片场功能
在视频创作中,如何编排人物走位和镜头角度,一直是我头疼的问题。主要原因还是缺乏相关专业知识和训练。以前需要长时间学习打磨,但现在有了更高效的AI工具。 TapNow最近上线了3D片场及相关功能,对新手非常友好。我用它做了一个片段,主要难点在于如何把脑海中的画面告诉模型,让它按我的想法安排人物走位和镜头角度。用3D片场可以先搭出大致场景:打开画布后,在左侧侧边栏点击加号选择3D片场,可直接导入内置...
2026-10-01
豆包内测独立App“小豆”,字节押注个人助理赛道
9月29日,新浪科技报道,豆包正在加速推进个人助理方向的产品落地,计划将内部代号为“Spell”的探索项目与豆包现有产品深度整合,新产品预期较快对外推出。 《读佳》进一步获知,豆包这款产品叫做“小豆”,并会推出独立App版本,小豆的名字在今年暑期就已确定。小豆目前还在内部测试阶段,最终对外版本有可能发生调整,一切以官方发布为准。 《读佳》就上述消息进行求证,截至发稿前,豆包方面暂无回应。 放...
2026-10-01
没有App只有手机号,这家公司凭什么估值百亿
Personal Agent 正成为热门产品方向。Meta 的 Muse 上线 10 天登顶美区 App Store 免费榜,OpenAI 开发者大会首个发布的产品也是 Dots。创业公司 Instinct 的交互方式尤为特别:没有 App,只有一个手机号、一台电脑和一个邮箱。用户发短信、打电话,它就去办事;遇到急事,它还会主动打电话。 用户用它玩出了不少意想不到的用法:有人扫描整个衣橱,让它每...
2026-10-01
腾讯WorkBuddy上线一键发布微信小程序功能
现在,不懂开发也能自己把一个想法做成并上线微信小程序了。今年的办公 Agent 大战竞争已进入新阶段,各家厂商都在 Agent 里连接自己的生态,帮用户做出更有用的东西,微信小程序就是其中一个典型场景,也是腾讯特别的生态优势。但想让 AI 独立走完整个微信小程序开发和上线流程依然不容易,原因是多数小程序代码来自商业项目,公开样本有限。 上周,腾讯 WorkBuddy 上线了微信小程序发布能力,把...
2026-10-01