
Hi,朋友们,我又来啦~ (今天开始,我要做日更博主!Flag立住!)
Opus 5.5 出来这一周,我的推特时间线基本被各种AI视频刷屏了。像素动画、界面动效、游戏史短片、AI 发展史纪录片,每一个都特别精细。
然后,我就忍不住剁手氪了5x的Max。(心疼我的票子)
剁手以后,我把推特上的各种Ai视频都扒了一遍,还给我的工作台做了个demo视频,就是这个。
说明:原文中共有 8 段视频演示。本文已内嵌对应视频,可直接点击播放(视频链接取自作者在 X 上发布的原始演示)。若视频无法加载,可点击文末「原文链接」查看原文。
这篇文章就给朋友们分享下怎么用Claude Opus 5.5 做AI视频。 (你用其他Ai大模型其实也可以,但出来效果如何就不好说了。)
具体包括Opus5.5做视频的实现路径、详细的案例拆解,以及提示词如何设计,我会尽可能把我的理解讲清楚一点,如果有错漏的地方朋友们记得提醒我一下。 (避免我误人子弟)
如果你不想写提示词,我还准备了一个Skill,方便朋友们测试。
OK,没问题我们就开始。

ZHOUXING’AI01. Opus 5.5 是怎么做视频的
说到Claude Opus 5.5做视频,有些朋友可能会觉得 Claude 已经能直接生成视频了。
其实不能。
Opus 5.5 能看文字和图片,但它输出的只有文字,和视频生成模型还是有很大区别的。
那画面是从哪里来的呢?
答案是代码。Opus 会写代码,代码可以在浏览器里做出画面,再交给别的程序把画面拍成视频。
不知道朋友们小时候有没玩过那种翻页动画书,每一页画一张图,快速翻过去,画面就会动起来。
用代码做视频,基本就是这个原理。
Opus 会写一个网页,网页里有一个函数,你告诉它现在是第几秒,它就把这一秒的画面画出来。然后再用一个程序,按照每秒 24 张或者 60 张的速度,把每一帧都截图下来,最后把几千张截图拼成一个 MP4。
不管你用哪种代码实现,大差不差都是类似的逻辑。然后根据你想要的画面风格,能用的代码大概有7类。

1. JavaScript+Canvas 2D:平面画布
简单来说,Canvas 就是网页里的一块画布,JavaScript 代码可以在上面画线、画圆、填颜色、写字。
像素风、扁平插画、手绘线条这些二维画面,基本都可以用JS+Canvas来实现。
2. HTML/CSS/SVG:网页元素
HTML 负责搭结构,CSS 负责颜色、圆角、阴影这些样式,SVG 是网页里的矢量图形,用来画图标、线条、曲线。
这套代码组合,就比较适合用来做软件产品宣传片,可以做出很丝滑的动效。
3. WebGL 着色器:显卡质感
WebGL 是网页里调用显卡画画的技术,着色器就是跑在显卡上的一段小程序,它会给画面上每一个像素单独算一个颜色。
老电视的扫描线和弧面、胶片颗粒、水面反光、发光的粒子,这些很复杂的质感都可以做到。这个一般是配合Canvas使用比较多,就是把Canvas里画好的内容,多加一层着色器增加质感,实现偏现实的3D效果或炫酷粒子效果之类。
4. Three.js:3D 场景
Three.js 是一个在网页里做 3D 的工具库,模型、材质、灯光、镜头都可以用代码搭出来。它底层用的也是上面讲的 WebGL,所以水面、雾气、光束这些着色器效果,可以直接叠在 3D 场景上。
前面几种都是平面的画面,用了 Three.js 以后,镜头就可以真的在空间里动起来,推近、拉远、绕着物体转一圈都可以。产品 360 度展示、立体的 Logo 和文字、由几万个光点组成的粒子云、方块堆出来的小镇,这类画面一般都靠它来做。
不过它也有局限。完全用代码搭的模型,基本都是方块、球体、圆柱这些基础形状拼起来的,做风格化的场景没问题,但要做一台跟实物一模一样的手机就比较难了。这种情况,最好把产品的 3D 模型文件一起交给 Opus,它可以直接导入进来做动画。
5. p5.js 艺术库:手绘笔触
如果想要彩铅、水彩、蜡笔这种手绘的感觉,常用的是 p5.js,再加一个叫 p5.brush 的笔刷插件,它可以模拟真实笔刷的方向、粗细和纸张纹理。
6. HyperFrames/Remotion:成熟视频框架
前面几种都是让 Opus 从零开始写,HyperFrames 和 Remotion 是现成的代码视频框架,这些通用的部分已经做好了,Opus 只管写画面就行。
这两个工具大差不差,做出来的效果也差不多,区别主要在于控制方式。
HyperFrames 按时间线控制,Remotion 按帧控制,所以理论上来说Remotion的可控性会更好一些。
我之前做抖音视频的时候,就这两个都有用过,其实差距上不是很大。
7. Manim:Python 动画引擎
Manim 是一个用 Python 写动画的开源工具,最早是 YouTube 频道 3Blue1Brown 的作者为自己的视频写的。
它的写法跟前面几种不太一样。你不用一帧一帧去画,只要用代码写出画面里有哪些东西,比如一个圆、一段文字、一条坐标轴,再写它们怎么变化,比如画出来、移过去、变成另一个形状,Manim 就会自动把中间的过程算出来。
优点是画面上的公式和图形都非常精准,缺点也比较明显,就是整体风格比较素,想要丰富的质感和设计感,还是前面几种更合适。
总共算下来,就是7种可以实现不同画面风格的代码方案。然后除了这个以外,我们在制作时还可以用到一些工具。
比方说Playwright,可以在后台打开一个看不见的浏览器,可以用来给代码画面截图。FFmpeg就是专门的音视频处理工具,处理好的画面、音乐这些都是通过FFmpeg来实现。
补充说一点,声音其实也可以用代码合成。
实际上声音就是一串波形。用 Python 里的 numpy、scipy 这些计算库,就可以把每一个音符的波形算出来,鼓点、贝斯、钢琴、合成器、界面的点击声都能做。
OK,上面这些代码类型如果你不懂的话其实也没关系,你可以把这部分内容收藏起来。只要能知道名字和大概能实现的效果,你就可以把它发给任何一个AI,让AI来实现。
ZHOUXING’AI02. 代码怎么组合,做出不同风格视频
上面提到的几类代码类型,其实不单可以单独使用,也可以组合起来实现不同的风格视频。
这一部分我挑了 5 条代表案例,风格差别比较大,用到的代码组合也不一样。
每一条案例的视频和拆帧我都会po出来,如果原作者有分享提示词的也会放在案例里。我们一起来感受一下,Opus5.5做视频,实际上能做到什么程度。
案例 1:像素巫师,只用 Canvas 2D
先看最简单的一条,像素巫师。
这条 11 秒的视频,其实是一个大概 5 秒多的循环播了两遍。巫师站着轻轻晃,然后举起法杖,杖头周围开始有蓝色的火花往里转,接着法杖往前一指,放出一个光圈和一道飞弹,最后收回来,再从头开始。
技术上,这条只用了一种代码,就是 Canvas 2D。你可以理解成在一个画布上进行绘画。
它的像素感主要来自两个做法。
第一,画布本身就很小。所有东西都先画在一块只有 128×96 的小画布上,再整数倍放大到全屏,放大的时候关掉平滑,所以每个像素都是清清楚楚的小方块。
第二,动作故意做得一顿一顿的。巫师的姿势每秒只变十次左右,看起来就像老游戏里一张一张画出来的像素动画;火花、飞弹这些特效则每一帧都在动,画面不会显得卡。
巫师本身也没有用任何图片,是代码用一个个小方块拼出来的,法杖角度、手臂高度这些都做成了参数,所以同一个角色可以做出各种动作。
另外除了马赛克风格以外,一些偏手绘、线条、二维的视觉效果,都可以尝试用这个来实现。
完整提示词是这个,朋友们可以直接复制去试试:
创建一个独立的单 HTML 文件,用原生 JavaScript 和 Canvas 2D 渲染一个正在施法的像素风巫师动画。不使用任何外部素材、库或网络请求。渲染- 所有内容先画在一块逻辑分辨率固定为 128×96 的离屏画布上,再按能放进窗口的最大整数倍放大,画到全屏的显示画布上,居中,设置 imageSmoothingEnabled = false 和 CSS image-rendering: pixelated。- 所有绘制都对齐到逻辑画布的整数坐标。不要亚像素位置、抗锯齿、渐变和 shadowBlur。- 固定调色板,大约 24 个颜色:夜空用深蓝和深紫,长袍用暖色,再加 3–4 个明亮的魔法色。每一个像素都必须来自这个调色板。角色- 用填充矩形和一串串像素程序化地搭出巫师,大约 24×32 个逻辑像素:带弯折的尖顶帽、长胡子、双色长袍加深色描边、杖头有宝石的法杖。- 把姿势做成参数(法杖角度、手臂抬起高度、头部倾斜、长袍摆动)。参数平滑变化,但每一帧都量化到像素网格上,这样虽然循环以 60fps 运行,动作看起来却像每秒 8–12 张的像素动画。动画- 循环状态机:待机(两帧上下晃动、胡子摆动)→ 蓄力(法杖举起、宝石闪烁、火花螺旋着向内聚拢)→ 施法(一道强光爆发,飞弹横穿画面,屏幕震动 1–2 像素)→ 收招(回到原位)。关键帧之间的姿势参数用缓动过渡。- 粒子系统预先分配好、循环复用,不产生新对象。蓄力时火花围着宝石转,施法时向外炸开,每个粒子消失前从白色经过魔法色变成深色。画粒子时位置对齐到像素网格。- 用固定的 60Hz 时间步长更新,用 requestAnimationFrame 渲染。循环里不产生任何新对象。场景- 极简背景:深色夜空、几颗闪烁的 1 像素星星、月亮、石头地面。角色的剪影必须清晰可辨。- 宝石给巫师打一圈 1 像素的轮廓光,蓄力和施法时变亮。质量标准- 任何窗口大小下像素都清晰,无缝循环,稳定 60fps,剪影清楚。看起来要像一段精致的 16-bit 游戏角色动画,而不是缩小了的矢量图形。
案例 2:界面变形,HTML/CSS/SVG 加弹簧和节拍
第二条界面动效。
从头到尾,画面里只有一个黑白的形状。
每一次变化都是一个鼠标光标真的点出来、拖出来的,而且卡在音乐的节拍上。
这条用到的是 HTML/CSS/SVG,按钮、文字、图表都是真的网页元素。但它看起来比普通网页动效高级很多,是因为作者在提示词里加了三样东西:
弹簧动画
节拍网格
运动模糊
如果你是想要做产品宣传或网页宣传,这种就会比较合适。
这是提示词,朋友们可以试试:
<inputs>开工前先问我:8–12 个界面状态(按钮、加载、播放器、滑块、开关、标签页、图表、命令面板、通知这些),纯黑白还是加一个强调色,以及一首 120 BPM 左右、可以商用的免版税音乐。</inputs><direction>Dribbble 级别的界面动效。从头到尾只有一个形状,永远不切镜头:每一个状态都是同一个元素改变尺寸、圆角和颜色变过去,里面的内容在一下短暂的模糊里切换。一个鼠标光标用真实的点击和拖拽驱动每一次变化。浅暖灰背景,黑白组件,一种干净的界面字体(Geist)。所有动画都用弹簧,最多带一点点回弹。镜头跟着缩放,让每个状态都占满画面。最后一帧和第一帧一样,可以无缝循环。禁止:弹跳缓动、粒子爆炸、发光、组件上的渐变、粗细不统一的图标、没有动作的空档、任何看起来像模板的东西。</direction><structure>120 BPM,7 个小节,每一拍都有事情发生。按钮 → 加载 → 对勾 → 灵动岛 → 音乐播放器(播放和暂停图标互相变形)→ 拖动进度条 → 变成音量滑块,拖过最大值时被拉长 → 开关踩着节拍翻转 → 开关的圆点变成标签页的指示条 → 标签页展开成一张自己画出来的图表,悬停时出现提示 → 收成 ⌘K 命令面板 → 输入筛选 → 回车 → 通知 → 回到按钮。</structure><build>1. 一个 HTML 文件,1440×1440。所有样式都在 seek(t) 里由时间算出来:不用 CSS 过渡,不用计时器,帧和帧之间不保存状态。2. 弹簧用公式直接算。一个值要多次改变目标时,把每一次变化的弹簧叠加起来,这样它始终只由时间决定。3. 标签页指示条的左右两条边用两个不同的弹簧,前沿先走、后沿后跟,移动的时候会被拉长。开关的圆点也这样做。4. 拖拽要像真的在拖:光标按住时,数值由光标的位置算出来;松手后从当前位置弹回去。5. 用 numpy 分析音乐,找出节拍网格,从重拍开始。每一个界面音效都放在对应动作的那一拍上。6. 用 Playwright 渲染,每帧截 4 张,用 ffmpeg 混合出运动模糊,输出 60 帧的视频。7. 渲整片之前,每一拍先渲一帧检查,偏离节拍、太挤、看不清的地方先修掉。</build><gotchas>被镜头缩放的元素、会渲染文字的元素,都不要加 will-change,否则文字会糊。在变形容器里切换的文字,要有自己的进场和出场时间,不然新旧文字会叠在一起。最后一帧要和第一帧完全一样,包括光标的位置和速度,否则循环的时候会卡一下。</gotchas><start>先问我要输入的内容,写任何代码之前,先把状态列表排在节拍网格上给我看。</start>
案例 3:游戏史短片,Canvas、着色器、3D 全混在一起
第三条是一条 2 分钟的电子游戏发展史。
这条是我最喜欢的一条,太酷了,不管是节奏还是多重画风都很舒服,我真的反复看了好多遍。
然后这里面,他其实是混合了几种不同的代码。
Canvas 2D
WebGL 着色器
Three.js(3D)
Python 合成配乐
其中着色器这一层,我让 Claude 复刻了一段。
左边是只有 Canvas 的画面,右边是加了着色器以后的:

同样 3 秒、90 帧,只有 Canvas 的版本渲染 7 秒,加上着色器以后是 48 秒。
所以你会发现,同一套像素画面,你是可以通过叠加不同代码来实现更多的质感的。
最有意思的是他的提示词,只有 7 行:
做一条 2 分钟的电影感视频,讲电子游戏的历史,要史诗、要动人,像一部纪录片预告片,全力以赴。配乐你自己写,完全用代码合成,不要采样,不要音频文件,不要虚拟乐器。画面要跟着音乐剪。1920x1080,60 帧。不要下载任何图片或素材,每一帧都用代码生成。最后把画面和音乐混在一起,渲染成 MP4,保存到【你指定的位置】。
他只写了想要什么效果,其他全部是 Claude 自己决定的。
案例 4:甜酷舞蹈,视频模型出人物、代码搭场景
前面三条,画面里的东西全部是代码画的。但代码有一个短板,写实的人物、复杂的舞蹈动作,它很难画好。
这时候可以换一个分工,人物交给视频模型,画面和动效交给代码。
比方说这条,就是先让 Grok 生成的原始视频和 Opus 5.5 做完的成片放在了一起。
原始视频是 15 秒,一个女孩站在纯绿色的背景前跳舞,除了人物什么都没有。
成片也是 15 秒,但画面完全变了:
拆开来看,Opus 在这里其实就做了三件事:
抠像
场景和动效
节奏
之前有朋友问我开头展示的那条视频是怎么做出来的。
其实用的也是同样的方式,在Claude里面接入了Flova。然后角色动画是由Oplus 5.5调用Flova实现的,其他就都是Opus 5.5的代码动效。
案例 5:AI 发展史,用 Remotion 讲一个完整的故事
最后一条是3 分钟 AI 发展史。
这条实际上就是用Remotion 做的,一共写了大概 7400 行 React 代码,每张图都是 SVG 和 Canvas 画的,配音用的是开源语音模型,配乐是 Python 合成的。
这个的提示词写得非常细。我对着抽帧一个场景一个场景看下来,画面基本就是照着提示词里的分镜走的。
你可以把主题、场景换成自己的试试:
你是一位动态设计师兼创意总监,正在制作一部 3 分钟的动画短片,完全用代码搭建,最后渲染成 MP4。这部片子标题:「Attention Is All You Need → AGI」讲的是 2017 年的一篇论文,怎样一步一步引出了大语言模型、推理、会用工具的 AI 智能体,以及 AGI 这个还没有答案的问题。它应该像一篇有电影感的影像随笔,而不是幻灯片或者时间线信息图。可以想象成 Kurzgesagt 遇上皮克斯电影的开场:有情绪、聪明、精准。技术设置用 Remotion(React)。新建一个项目,1920×1080,30fps,时长正好 180 秒(5400 帧)。每个场景一个 composition,在一个主 composition 里按顺序排好。不用任何外部图片素材或现成视频:所有东西都用 SVG、Canvas、CSS 和代码生成的粒子、形状来画。可以用 Google Fonts。动手之前,先写一份 STORYBOARD.md,写清楚每个场景的时间、画面、屏幕上的文字和转场。然后一个场景一个场景地做。每做完一个场景,渲染 3–4 张静帧(npx remotion still),用挑剔的眼光看一遍。先修好排版、重叠、可读性和节奏,再做下一个。最后用 npx remotion render 输出到 out/film.mp4。给音乐留一个可选的 <Audio> 位置(public/music.mp3),我之后再加;如果文件不存在,就渲染无声版。叙事主线 / 贯穿全片的母题主角是一个会发光的词元,也就是单词「the」,它穿过每一个时代。2017 年,它是一个孤独的光点,突然通过注意力连线「看见」了所有其他单词。随着时间推移,它有了声音、感官(多模态)、推理能力、双手(工具),最后,有了一个问题。场景(时间是大概的,你可以重新分配)0:00–0:15 冷开场。一片黑暗。单词像星星一样散落,彼此不相连。RNN 式的逐个处理:单词一个接一个亮起,慢慢忘掉前面的。0:15–0:35 2017 年 6 月,「Attention Is All You Need」(Vaswani 等人,Google)。每个单词同时连到其他所有单词。注意力连线绽放成一张网。论文标题像排版印刷一样出现。0:35–0:55 2018–2020:大语言模型崛起,GPT-1、BERT、GPT-2、GPT-3。规模定律:这张网指数级增长,镜头往后拉。模型开始补全句子,流畅得有点诡异。0:55–1:20 2022:指令微调和 RLHF,然后是 ChatGPT(2022 年 11 月 30 日)。词元有了一个聊天气泡。用户数计数器爆炸式增长。世界开始跟它对话。1:20–1:40 2023:多模态。图像、音频和代码从四面八方流进同一张网,词元有了「感官」。每一种模态都变成词元,流过同一个注意力机制。1:40–2:05 2024–2025:推理模型。一条看得见的思维链展开,分叉、剪枝、回溯。模型「先想再说」,时间变慢。2:05–2:30 工具使用和智能体。词元长出了双手:它调用搜索、运行代码、打开文件,调度子智能体。很多条线程同时工作,屏幕变成一个忙碌又漂亮的工作室。2:30–2:50 走向 AGI。所有母题汇合。2017 年的那张网重新出现,但现在是星球尺度。保持开放:不要乌托邦,也不要末日。屏幕上写:「Attention was all we needed. What comes next is up to us.」(如果你能写得更好,就改进这句话。)2:50–3:00 回到黑暗中一个发光的词元。片名卡,结束。制作规则准确性很重要:年份、人名、论文标题都要正确。对某个具体事实没把握时,宁可不写也不要猜,并把所有不确定的说法列在 NOTES.md 里。文字排版:屏幕上同时最多约 8 个单词,每段文字停留时间要够读完(至少 2.5 秒)。用一种展示字体,再用一种等宽字体表示「模型输出」。动效:用弹簧和缓动曲线,不要线性运动。场景之间的转场要从内容里长出来(网络变形、镜头穿过一个节点),不用通用的淡入淡出。颜色:深色背景,加一个暖色强调色,这个强调色随着时代慢慢变化。细节和彩蛋留给认真看的人(比如真实的论文片段、小小的界面细节、看起来可信的模型输出),像高水准的动态设计作品那样。节奏:密集和平静的时刻交替,给推理那一场和 AGI 那一拍留出呼吸的空间。全程自主完成整条流程。做完以后,告诉我 MP4 的路径、一段简短的创作决策总结,以及 NOTES.md。
ZHOUXING’AI03. 提示词怎么写,才能稳定出片
前面我们已经把几种代码分别能做出什么效果、什么风格的视频过了一遍,也拆了几个完整的案例。
在讲提示词之前,还有一类视频要单独说一下。
这几天推特上刷得最多的,其实是下面这种。15 秒里镜头快切,画面很炫酷,配乐和音效也都有。
但我没有单独拿来做案例,因为这种视频基本没有可控性。
它的提示词就一句话:
做一条 15 秒的动态图形视频,展示你是一个多么厉害的动效设计师,就像是你放进简历里的作品集。全力以赴。
拿它来测试一下 Claude 的上限,是挺好用的。
但如果你是想拿 Claude 做点用得上的东西,比方说给自媒体账号做视频、剪视频,给自己的产品做宣传广告,或者做一些有情绪、有故事的片子,这句话其实是用不上的。
你更需要的,是一个稳定、好用、能做出你想要的效果的提示词框架。
那提示词要怎么写呢?
我把这次看到的效果比较好的提示词放在一起对比,发现一个挺有意思的地方。
流传最广的那几份,用的都不是我们平时常见的 Markdown 格式,而是这种用尖括号标签把内容包起来的写法:
<direction>这里写画面风格,还有明确不要的东西</direction>
这种写法叫 XML 标签,Anthropic 的官方文档,有专门提到。
提示词里同时有要求、背景资料、示例这些不同内容的时候,用 XML 标签把每一类单独包起来,Claude 能更准确地分清哪部分是什么,不容易理解错。
整体的框架,其实和Markdown写法差不多:
<role>:让 Claude 当什么角色,动效设计师、科普作者还是产品导演<inputs>:开工前先问你要什么,主题、时长、画幅、配色、参考图、音乐,你没给的不许它自己编<direction>:画面风格,还有明确的禁止清单<structure>:分镜和节奏,几个镜头、每个多长、怎么转场、卡在哪一拍<build>:技术路线,用哪几种代码、怎么渲染、怎么配乐<gotchas>:这种做法最容易出问题的地方<start>:第一步先做什么,等你确认了再往下
这里面比较容易被忽略、也比较影响效果的,是 <direction> 里的禁止清单。
Opus 在没有限制的时候,会回到它熟悉的默认风格,深色背景、居中的大字、所有东西淡入淡出。
所以为了拿到不一样的效果,提示词这里就要把「不要什么」写得具体一些。
比方说不要弹跳缓动、不要粒子爆炸、不要发光、不要组件上的渐变、不要任何看起来像模板的东西。
然后呢,这里我准备了一个通用提示词模板,朋友们直接用这个也是可以的。
<role>你是一位动态设计师,也是一位创意程序员,擅长用代码做出有设计感的视频。</role><inputs>开工前先问我这几件事,我没给的不要自己编:1. 主题,以及看完以后希望观众记住的一句话:【你的主题】2. 时长和画幅:【30】秒,【1920×1080 / 1080×1920 / 1080×1080】,【30 / 60】帧3. 风格:【像素 / 扁平插画 / 界面动效 / 彩铅手绘 / 复古电视 / 3D】,有参考视频或截图就发给你4. 配色和字体:【主色 #颜色】,【字体】5. 声音:【我提供的音乐文件 / 用代码合成配乐】,要不要配音:【要 / 不要】</inputs><direction>整片只用一套风格、一套配色,同一个角色或元素在每个镜头里的样子都要一致。每个镜头只讲一件事,画面上的字少而大,每段文字至少停留 2.5 秒。动画用缓动或弹簧,不用匀速运动。转场从画面内容里长出来,比如一条线变成下一个场景的地平线,不用默认的淡入淡出。镜头要跟着内容动,推近、拉远、跟随,让主体在画面里足够大。禁止:【居中大字加渐变背景的默认风格、所有元素同时淡入、满屏小字、任何看起来像模板的东西,按你的情况补充】</direction><structure>先写分镜表,每个镜头写清楚:镜头 [N]|[开始–结束秒]画面:构图、元素、文字动作:进场、主要动作、出场镜头:推、拉、跟随还是固定声音:这一段的音乐和音效转场:怎么过渡到下一个镜头如果有音乐,先分析节拍,镜头切换和关键动作都落在拍子上。</structure><build>1. 画面用【Canvas 2D / HTML+CSS+SVG / WebGL 着色器 / Three.js / Remotion / HyperFrames】来做,不用外部图片和素材。2. 页面暴露 window.render(t),画出第 t 秒。所有画面只由 t 算出来,随机数带固定种子,不用计时器,帧和帧之间不保存状态。3. 用 Playwright 逐帧调用 render(t) 并截图,再用 ffmpeg 合成 MP4。4. 配乐和音效用 Python(numpy、scipy)从零合成,每个音效放在画面动作发生的那一帧上;有配音的话,整段合成,不要一句一句拼。5. 每做完一个镜头,先渲 3 张静帧自己检查:文字有没有溢出、元素有没有重叠、画面够不够满,修好了再做下一个。</build><gotchas>- 字体加载完再开始截图,不然前几帧会用默认字体。- 用了 WebGL 的话,先渲一帧确认着色器真的生效了,再渲整片。- 你听不到声音,所以要把音频的波形画成图自己检查,确认没有爆音。</gotchas><start>先问我 inputs 里的问题,然后给我分镜表,等我确认。再渲 3 张关键帧让我看风格,确认后再渲整片。</start>
如果你连提示词也不想复制,我还把这一整套流程做成了一个 Skill,叫 xilo-opus-video,已经开源在 GitHub 上。
安装的话,把下面这句话丢给AI就可以:
帮我安装这个 Skill:https://github.com/Kianzzz/xilo-opus-video
装好以后,你只要跟它说想做个视频,它就会调用skill:
- 先问你要做什么
:给一个想法也行,丢一篇文章、一个产品网址也行,甚至直接给一条参考视频,它会先抽帧分析这条视频的镜头和节奏;你给了现成的音乐,它也会先测出节拍,再按拍子排镜头 - 给你三个方案
:每个方案写清楚风格、用哪几种代码、逐镜头的画面概括、声音怎么做、大概要渲染多久,三个方案会刻意拉开差别 - 每个方案出一个预览
:一般是一张关键帧,卖点在动效的方案会出一段几秒的小样,你看着画面挑,不用只靠文字想象 - 你确认以后再开做
:它会先把确认的方案写成一份 brief.md,里面就是前面讲的 7 块提示词,然后按这份提示词一个镜头一个镜头地做,每做完一个镜头自己出静帧检查,整片出来以后,再按上一节那几项给自己打分,改到每项 8 分以上才交给你
另外,还有几个提升视频效果的小技巧。
一是思考强度。如果你做出来的效果不太OK,可以先把这个调上去。
二是在项目文件夹里放一份 CLAUDE.md。Claude Code 每次开工都会先读这个文件,所以你可以把做视频的规矩写在里面,这个文件夹里做的每一条视频都会自动遵守,不用每次都在提示词里重复:
# 视频制作规矩## 渲染- 每一条视频都只由时间决定:window.render(t) 画出第 t 秒。- 不用 CSS 动画、不用计时器,帧和帧之间不保存状态,随机数带固定种子。## 画面- 禁用的默认风格:居中大字加渐变背景、所有元素一起淡入、角落里的标签和边框、界面上的发光。- 一种标题字体、一种正文字体,除非我另外说明,只用一个强调色。- 每 2–4 秒画面上要有新东西出现。## 声音- 没有给音乐的话,配乐和音效都用代码合成,放在节拍上,响度 -14 LUFS。## 给我看之前- 先出抽帧图,自己打分,把最严重的 3 个问题改掉,每一项都到 8 分以上再给我看。
三是让Claude自查。
检查视频,先完成抽帧处理,然后站在严格的动效导演视角,专门挑毛病,别替自己说好话。按下面几项各打 1–10 分:前 2 秒抓不抓人、缩到手机屏幕大小还看不看得清、动作是否自然(有没有匀速滑动、有没有卡住不动的空拍)、画面变化是否足够(每 2–4 秒要有新东西)、构图、声音和画面是否对得上。列出最严重的 3 个问题,标上时间点。重点找这几类:切换时文字叠在一起、居中大字加渐变背景的默认画面、角落里多余的标签和边框、缩放以后变糊的字、循环接缝处的卡顿。列出以后重新渲染有问题的部分,再出一张新的抽帧图和新的分数。重复这个过程,直到每一项都在 8 分以上。
ZHOUXING’AI写在最后
OK,今天的内容到这里就差不多了。
简单回顾一下。Opus 5.5 自己不会生成视频,它是写代码把画面一帧一帧画出来,再拍成视频。但因为Opus5.5有很好的代码编辑能力和审美能力,所以呢它做出来的视频效果都很OK。
如果你想继续深挖,下面这几个开源仓库可以收藏一下:
athemeroy/awesome-opus-5-5-videos
guanmo-ai/awesome-ai-motion
JohnHeibel/ClaudeAnimationBase
JohnHeibel/PDoomVideo
最后也要感谢这些把作品和做法公开出来的作者,这篇文章很多内容,都是在他们的基础上折腾出来的。
以上就是全部,希望这篇文章,可以给朋友们一些帮助。
祝好🍀
来源:微信公众号「周行今天AI了吗」原文链接


评论0