上周,一个做户外装备的客户发来一条30秒视频,问得很直接:你们天天讲 AI 产品动画怎么做,我自己也生成了一条,为什么废了?我看了十秒就明白问题出在哪——帐篷拉链在乱动,支架穿模,镜头直接从产品内部穿了过去。可他用的工具跟我们用的是同一类,区别只在于:他的提示词总共写了三行。AI产品动画怎么做,答案从来不在按钮上,而在提示词结构和资产逻辑里。
网上关于 AI 产品动画怎么做的教程,九成在教界面:哪个按钮点开、哪根滑杆往左拉。但真正决定一条片子能不能用的,是三件事——提示词有没有写清物理结构、有没有 3D 资产托底、迭代节奏是不是分镜先行。我们内部跑过两百多条片子,方法论基本就沉淀在这三件事上。下面拆开讲,新手也能照着做。
一、先纠正一个认知:AI 不是「一句话出片」
产品动画的判定标准是「产品对不对」,而不是「画面美不美」。观众也许不懂渲染,但他天天用这个产品——瓶盖有几道纹、按键在左边还是右边、开合方向朝哪边,他一眼就能看出来错。所以 AI 在产品动画里扮演的是「渲染加速器 + 运镜执行者」,不是「产品的发明者」。你把这一点想通,很多焦虑就消失了:AI 负责把画面做漂亮、把镜头走顺,产品的真实性必须由你的输入来保证。
二、提示词的四层结构:把形容词换成可执行参数
新手最常写的是形容词:「高级感」「科技感」「大片感」。这些词对模型来说等于没说,它只能随机猜。我们内部固定用四层结构写提示词:
- 第一层 · 主体结构:磨砂深灰不锈钢保温杯,直筒造型,杯身近底部有一圈 0.5mm 凹槽,旋盖式杯盖,顶部带硅胶提环;
- 第二层 · 材质表面:316 不锈钢拉丝表面,粗糙度中等,杯口边缘抛光,硅胶件为哑光;
- 第三层 · 光影环境:顶部大面积柔光箱,右侧暖色轮廓光,背景中灰渐变,地面弱反射;
- 第四层 · 运镜节奏:低角度 45° 起幅,机位匀速右移,等效 85mm 焦段,末端缓慢推近至杯盖特写,节奏先稳后缓。
四层缺一层,出来的画面就会「飘」。特别提醒:第四层不要写「镜头很酷」,要写机位、方向、焦段、速度——这些才是模型听得懂的语言。
三、三个高频翻车点,几乎每个新手都会踩
形容词病:用感受词代替物理描述,模型只能自由发挥,十次能出一次对的算运气好。参数堆砌:把八个风格词全塞进一句提示词,几种风格互相拉扯,最后画面被折中成一张平庸的图。无视物理逻辑:产品动画必须遵守重力、卡扣、开合方向这些基本规则,杯盖不能像花瓣一样散开,脚架不能穿过地面——写提示词时把「怎么动」交代清楚,比写「动得好不好看」重要得多。
四、为什么能落地的 AI 产品动画,背后一定有 3D 资产
纯靠文字生成视频,有三个绕不过去的死穴:结构还原不准、多镜头之间产品长相不一致、CMF(颜色/材质/工艺)无法精确控制。我们的做法是先用产品图纸或实拍照片建一个轻量级 3D 模型——不需要影视级精度,够还原轮廓和分件就行——再让 AI 完成材质扩展、场景搭建和运镜渲染。这样产品永远长得一样,镜头怎么切都不会「换脸」。具体建资产的路径可以看我们之前写的 AI生成3D模型工作流全解析,从照片到可渲染资产的完整链路都在里面。
五、迭代节奏:分镜先行,别让 AI 替你写剧本
很多人一上手就让 AI 生成 30 秒,结果拿到一堆没法拼接的碎片。正确顺序是:先写分镜表(几个镜头、每个镜头讲什么、多长)→ 每镜单独生成并锁定种子 → 每次只调一个变量 → 挑片 → 后期合成。动作类镜头可以参考 AI驱动动作生成 那篇里的处理思路,把「动作由谁驱动」和「画面由谁渲染」拆开,效率会高出一大截。
六、最后 20% 决定质感:色彩与合成
生成出来的画面直接剪,通常会显得「塑料」:高光死白、暗部糊成一团、整体色偏。收尾阶段要做三件事——统一各镜头的白平衡与色彩倾向、压高光提暗部、给产品加一层很轻的地面反射和接触阴影。这套色彩处理的逻辑我们在 电商产品动画的色彩科学 里讲得比较细,套用过来一样成立。
七、新手的第一条练习:8 秒,3 个镜头
选一个你手边的产品,拍 4 张不同角度的照片,按四层结构写提示词,只做三件事:一个 3 秒的环绕镜头、一个 3 秒的细节特写、一个 2 秒的开合动作。做完后逐帧检查穿模、形变和光影跳变。能过这一关,你就已经掌握了 AI 产品动画怎么做这件事里最核心的 80%。剩下的 20%,是量产时的稳定性和多镜头一致性——那部分通常需要 3D 资产库和流程管理,自己啃会比较慢,也可以直接 联系我们 聊聊你的产品。
