开工之前,先问一个问题:你手头只有一张商品白底图,但亚马逊运营要求你一周内交 6 张 Listing 主副图,外加 3 套视频脚本,预算还几乎为零。这种事在电商公司里太常见了,尤其是做跨境电商新品的阶段。
过去我们只能找设计师一张张抠图、合成、渲染,花销高、周期长,改一版需求又要重新排期。现在有了 AI 图像生成和视频生成工具,这件事的性价比已经高了很多。这篇文章不会讲那些“输入一句话自动出图”的玄学,而是分享一套从单张商品图扩展到完整 Amazon Listing 视觉素材的工程化流程,包括图像生成、一致性控制、批次产出、视频分镜脚本设计,以及我实际跑下来遇到的高频问题和规避方案。
文章适合运营、产品开发、独立站卖家和想用 AI 工具提升效率的设计师。读完你会掌握:如何用图生图方式控制商品结构不变形,如何批量产出多角度/多场景图,如何设计 3 套视频方案的镜头脚本,以及哪些环节最容易翻车、怎么提前避开。
1. 为什么一张商品图能扩展出整套素材
1.1 亚马逊 Listing 图到底需要几张
先明确一个概念。亚马逊 Listing 通常由 1 张主图和最多 8 张副图组成,实际运营常用的配置是 1+5,也就是 1 张白底主图加 5 张功能/场景/细节图。
- 主图:纯白底、商品占画面 85% 以上、不能有文字水印或 Logo,这是亚马逊的硬性规定。
- 副图 1:常放尺寸/规格图,解决“这个产品多大”的问题。
- 副图 2:常放核心卖点图,强调材质、工艺或结构。
- 副图 3:常放使用场景图,让用户脑补“我在什么场景用它”。
- 副图 4:常放对比图或细节图,突出相对竞品的优势。
- 副图 5:常放包装/配件图或品牌故事图,提升信任感。
很多卖家会把这些图理解为“设计需求”,其实它们更像是“信息架构需求”。每张图要回答用户的一个疑问,排列顺序也对应着用户的决策路径。你只有一张商品图,但可以通过生成多个背景、多个角度、多个场景,把上述信息点填满。
1.2 传统做法和 AI 做法的成本差异
传统模式下,一张高质量场景图可能需要摄影师、模特、场地、灯光、道具,单张成本从几十到几百不等,还要等排期。如果是结构复杂的产品,3D 渲染还要建模、贴材质、调灯光,周期按周算。
AI 方案的核心思路是:以已有的商品图作为条件输入,通过图生图、ControlNet 边缘约束、局部重绘、图像扩展等方式,在不改变商品主体结构的前提下,生成不同背景、不同角度、不同氛围的图像。生成的结果未必 100% 完美,但作为 Listing 副图素材,再经过一轮轻量后期修图,效率远超纯人工。
这里要强调一个原则:AI 生成不能替代合规审校。亚马逊对图片有明确规范,主图必须白底,商品不能有阴影或文字遮挡,副图不能包含价格、促销信息、联系方式。AI 生成的图片如果出现多余文字、畸形结构或误导性场景,仍然需要人工检查。
1.3 这套流程适用的人群和产品类型
我跑通这套流程后发现,最适合的产品类型有三类:
- 中小体积实物商品,比如厨房小家电、家居收纳、数码配件、玩具、美妆工具。
- 外观特征明显,但不需要精确复刻材质纹理的商品,比如工具类、户外用品。
- 需要快速产出多套 A/B 测试素材的测款场景。
不太适合的产品类型包括:成分/配方必须精确展示的食品保健品、需要严格尺寸标注的工业零部件、涉及人体佩戴效果且对模特五官有严格要求的产品。这类需求建议保留传统拍摄或 3D 建模方案。
2. 环境准备与工具选型
2.1 图像生成方向:推荐的工作台组合
我目前常用的组合是 Stable Diffusion WebUI / ComfyUI 图生图工作流,配合 ControlNet 的 Canny 或 Depth 预处理器使用。如果你没有本机部署条件,也可以使用在线平台的“图生图”功能,但可调参数和批量处理能力会弱一些。
版本方面:Stable Diffusion 本身迭代很快,不同版本的模型对同一张图的解析效果差异较大。建议优先使用 1.5 或 SDXL 生态的通用模型。这里不写死具体版本号,因为实际项目中需要根据你的显存、显卡型号和模型兼容性来定。核心思路是:底模负责画质和风格,ControlNet 负责锁定商品轮廓,后期重绘负责改背景,三者各司其职。
部署方式,如果本机有 NVIDIA 显卡且显存 8GB 以上,建议 ComfyUI。ComfyUI 的优势是节点化流程,适合把“商品图 → 多背景生成”这种重复流程做成模板,换图不换流程,非常适合批量产图。如果显存不够,优先考虑云 GPU 平台或者在线生图平台的 API,按量付费,前期成本更低。
2.2 视频生成方向:流程比工具更重要
视频方案上,目前可用的方式有三类:
- 图生视频:上传生成的场景图,让 AI 驱动商品或镜头运动,适合 5-15 秒的产品展示短视频。
- 文生视频 + 图生视频结合:先生成关键帧,再对关键帧进行运动控制。
- 视频编辑工具:将生成的短视频片段拼接,加入文字、音乐、字幕,形成完整素材。
不要过度纠结于某一个具体工具的名字,因为视频生成领域几乎每个月都有新功能上线。你真正需要理解的是底层逻辑:视频方案的产出 = 静态图素材 + 镜头语言设计 + 多段视频拼接。
2.3 素材整理规范
这套流程要处理多张输入图、多组提示词、多个输出图,如果不做素材管理,很快就会乱。建议按以下目录结构管理:
product_assets/ ├── input/ │ └── product_white_bg.jpg ├── output/ │ ├── 01_main_image/ │ ├── 02_feature_image/ │ ├── 03_scene_image/ │ ├── 04_size_image/ │ ├── 05_detail_image/ │ └── 06_compare_image/ ├── prompts/ │ ├── base_prompt.txt │ ├── negative_prompt.txt │ └── style_presets/ └── video/ ├── script/ └── storyboard/这样做的好处是,当你需要调整某一类图片时,可以直接定位到对应目录,不需要从头翻。
3. 把单图变成一套 Listing 图的核心原理
3.1 图生图不是“让 AI 自由发挥”
很多人第一次用图生图时,直接上传商品图,然后写一句“帮我生成一张好看的场景图”,结果出来的图结构变形、商品面目全非。原因在于,图生图的默认行为的“参考构图”,不是“保留商品本体”。
要让 AI 保留你的商品结构,需要做到两件事:
第一,降低重绘幅度(Denoising Strength)。在图生图参数中,重绘幅度控制着输出图与输入图的差异程度。数值越低,保留的原图信息越多,适合结构固定的商品;数值越高,AI 自由发挥的空间越大。当数值超过 0.7 时,很多商品图已经基本看不出原结构了。
第二,引入 ControlNet 的边缘/深度约束。ControlNet 可以从原图中提取商品的边缘线稿或深度图,作为生成时的强制条件,让 AI 在换背景的同时,保持商品的轮廓位置不变。这是目前保持商品一致性最有效的手段。
以下是一个常见的参数参考范围:
| 参数 | 推荐范围 | 说明 |
|---|---|---|
| 重绘幅度 | 0.3-0.55 | 数值越大背景变化越大,但结构变形风险越高 |
| ControlNet 权重 | 0.6-0.9 | 数值越高结构越稳定,但画面越死板 |
| Canny 边缘阈值 | 100/200 | 低阈值保留更多细节,适合复杂商品 |
| 生成步数 | 25-40 | 步数过低容易产生噪点 |
| 提示词引导系数 | 7-12 | 过高容易导致过饱和,推荐 8 左右 |
3.2 提示词的结构化写法
很多新手写提示词是把一堆形容词堆在一起,效果全靠“抽卡”。但做电商图需要稳定可控,提示词应该有固定结构。
我习惯把提示词拆成四个部分:
- 主体描述:商品名称、核心材质、颜色。
- 环境描述:背景类型、光线方向、氛围。
- 构图描述:角度、景别、镜头语言。
- 风格修饰:摄影风格、画质关键词。
示例:
a stainless steel electric kettle, matte black finish, standing on a modern wooden kitchen counter, soft morning light from left window, blurred cozy kitchen background, professional product photography, 85mm lens, shallow depth of field, high resolution, sharp details, 4k翻译成人话就是:主体是不锈钢电水壶,亚光黑,放在厨房台面上,左边窗户打光,背景虚化,专业产品摄影风格。
这里要注意:提示词是给模型看的,不需要写完整的中文句子,用英文关键词组合效率更高。但如果你的模型对中文支持较好,也可以中英文混用,关键是你自己要能读懂并持续微调。
3.3 负面提示词的作用
负面提示词用于告诉模型“不要画什么”,在商品图上尤其重要。常见需要屏蔽的内容包括:
text, watermark, logo, low quality, blurry, deformed, distorted, extra fingers, bad anatomy, cropped, oversaturated, jpeg artifacts, signature, username如果你生成的是场景图,还要额外屏蔽与场景无关的元素,比如 outdoor, people, car, text 等等。负面提示词写得好,能显著减少后期修图成本。建议维护一份通用负面提示词列表,放在你的工作流里。
3.4 种子值与随机性控制
每次生成图片时,模型会使用一个随机种子(Seed)来控制初始噪声。如果你对某次生成的构图很满意,但想微调光线或背景,可以固定种子值,只修改提示词或部分参数,这样输出结果会在“同一方案”的基础上变化,不会完全变成另一张图。
批量生成 6 张图时,我建议采用“固定种子 + 不同提示词环境词”的方式,而不是每次随机种子。这样可以保证不同副图之间商品的位置、大小、视角更接近,视觉一致性更强。
4. 实战:生成 6 张 Amazon Listing 图的完整流程
下面以厨房电子秤为例,演示从一张白底图生成 6 张 Listing 图的全流程。你不需要完全照搬这个商品,重点是理解每一步在做什么,然后换成你自己的商品。
4.1 准备原始商品图
原始商品图质量直接决定最终效果。具体要求如下:
- 白底或纯色底,商品主体清晰,无明显遮挡。
- 商品占画面比例尽量大,四周留白适度。
- 光照均匀,细节可见,不要有严重反光或阴影。
- 分辨率建议不低于 1024×1024,否则放大后会出现细节模糊。
如果你只有一张 800×800 的旧图,可以先在图像处理工具中裁剪干净,再用图生图的放大功能把底图清晰度拉高。但要注意:AI 放大不是万能的,原图过于模糊会导致后续生成结果结构漂移。
4.2 生成策略:一张图对应一个信息目标
收到 6 张图的需求,不要直接生成 6 次“不同风格的商品图”,而是要像做运营一样思考每张图的使命。
我设计的 6 张图规划如下:
| 图片位置 | 信息目标 | 生成策略 |
|---|---|---|
| 主图 | 白底全貌 | 直接用原图或轻修原图,无需 AI 重绘 |
| 副图 1 | 尺寸与结构 | 生成简洁背景下的正面视角图 |
| 副图 2 | 核心功能卖点 | 生成手触摸/倾倒动作场景图 |
| 副图 3 | 使用场景 | 生成厨房台面场景图 |
| 副图 4 | 细节材质 | 生成微距特写风格图 |
| 副图 5 | 包装与配件 | 生成带包装盒的可视化图 |
这样安排的好处是,每一张图都有明确的信息增量,后 5 张图不会重复。实际操作时,你可以把这 5 类图的提示词作为基础模板,再根据产品差异化微调。
4.3 用图生图生成主图和副图
主图我通常不做任何 AI 处理,直接用原始白底图做亮度、色温、轻微锐化调整即可。原因很简单,亚马逊主图审核严格,AI 生成的白色背景往往不是纯白(RGB 255,255,255),而是带灰调或环境色,会造成审核驳回。
如果你一定要用 AI 生成主图,建议生成后把背景抠掉或直接在图像处理工具中替换为纯白底,不要直接上传。
副图 1 的提示词参考:
a black kitchen scale on a plain light grey background, front view, centered composition, soft studio lighting, minimal style, product photography, high resolution, no text, no watermark这里的关键是 light grey background 和 minimal style,给出一个干净的展示环境,让用户注意力集中在商品结构上。
副图 3 的使用场景图:
a black kitchen scale on a modern white marble kitchen counter, next to a bowl of fresh fruits, warm natural window light, kitchen background softly blurred, lifestyle product photography, professional composition, high detail, 4k场景图是最容易出效果、也最容易翻车的类型。当你添加了“厨房台面”“水果”等环境元素后,AI 可能会把背景元素画得过大或过小,与真实比例不符。因此生成场景图时要重点检查商品和背景物体的相对大小。
4.4 用 ControlNet 锁定商品结构
如果你直接用上面的提示词跑图,大概率会出现以下情况之一:电子秤的形状变了、按钮位置变了、显示屏上的数字变成了乱码。
要解决这个问题,需要打开 ControlNet,选择 Canny(边缘检测)或 Depth(深度图)预处理器。
Canny 的工作流程:
- 上传原始商品图到 ControlNet。
- 预处理器选择 Canny。
- 控制权重设为 0.8 左右。
- 生成时模型会优先参照 Canny 线稿的形状。
Depth 更适合有立体结构的商品,比如吹风机、咖啡机、手持工具。如果你的商品是扁平结构,比如电子秤、手机壳、鼠标垫,Canny 更合适。
需要注意,ControlNet 权重过高会让画面失去“新背景”的乐趣,权重过低又会结构漂移。我习惯先固定权重 0.8 跑一张,如果背景没有变化,再逐步降到 0.7、0.6 继续测试。
4.5 批量生成与筛选标准
6 张图每张至少生成 4-6 次,也就是总共 24-36 张候选图,从中筛选最合适的 6 张。不要指望一次生成就成功。
筛选标准按优先级排列:
- 第一优先:商品结构是否正确,有无变形、多出不该有的部件。
- 第二优先:商品表面文字/Logo 是否清晰,出现乱码文字的直接淘汰。
- 第三优先:背景是否符合预期,场景比例是否真实。
- 第四优先:整体光影是否自然,有无明显噪点或涂抹感。
- 第五优先:构图是否留有文字和卖点图标的位置。
因为 Listing 副图通常还会叠加上卖点文字和图标,所以生成时最好在商品周围预留空余区域,避免生成结果过于满构图,后期无法加字。
4.6 后期修图与合规处理
AI 生成的图不能直接用,至少要做三步处理:
第一步,抠图修正。如果商品边缘有半透明残留、毛边或背景色渗出,需要在图像处理工具中手动修复。
第二步,叠加上架信息。副图最终是要加卖点文字、尺寸标注、图标箭头的,AI 生成图负责提供底图,排版信息在后期完成。
第三步,导出格式。亚马逊图片建议 JPG 或 PNG,最长边至少 1000 像素,推荐 1600 像素以上,以便支持缩放查看功能。
这里的合规提醒:确保你上传的图片不含价格、促销语、联系方式、AWS 标志或任何可能误导用户的内容。
5. 从静态图到 3 套视频方案
很多卖家会问:静态图还没有做完美,怎么就开始做视频了?但实际运营中,视频是独立的广告素材,并不需要等 Listing 图全部定稿后再启动。我的做法是:静态图先出 3-4 张合格底图,然后同步开始设计视频分镜。
5.1 视频方案的核心结构
一条商品短视频通常由三个部分组成:开头吸引、中段展示、结尾转化。
- 开头 0-3 秒:通过场景或特写吸引注意力,避免用户刷走。
- 中段 3-12 秒:展示商品外观、功能、使用过程或对比结果。
- 结尾 12-15 秒:再次露出品牌、强调购买理由。
3 套视频方案的区别不应该只是“换个 BGM”,而要有明显的镜头逻辑差异。建议从三个角度切入:功能展示型、场景氛围型、问题解决型。
5.2 方案一:功能展示型视频
这套方案适合功能点明确的商品,核心目标是让用户快速理解“它怎么用”和“它有什么用”。
分镜参考:
| 时间 | 画面 | 文案/字幕建议 |
|---|---|---|
| 0-2s | 商品白底图快速缩放进入画面 | 品牌名或产品名 |
| 2-6s | 手部放置物品到电子秤上,重量数值跳动 | 高精度传感 |
| 6-10s | 切换单位/去皮功能操作特写 | 一键去皮 |
| 10-13s | 商品放在厨房台面整体环境 | 极简设计 |
| 13-15s | 回到白底主图,加品牌 Logo | 购买按钮 |
操作方式:先分别生成“白底图”“手部操作图”“厨房场景图”三张关键帧,然后利用图生视频,让 AI 在关键帧之间生成运动过渡。使用这种方案时,商品的按钮、屏幕显示变化通常无法完美模拟,建议后期用剪辑工具叠加动态文字或局部放大来处理。
5.3 方案二:场景氛围型视频
这套方案适合外观设计有卖点、强调生活品质的商品。核心不是讲功能,而是营造代入感。
分镜参考:
| 时间 | 画面 | 音乐/氛围要求 |
|---|---|---|
| 0-3s | 清晨厨房光线洒入,商品在台面上 | 轻快、舒缓 |
| 3-6s | 镜头缓慢推近商品,背景有咖啡杯和绿植 | 环境音 |
| 6-10s | 俯拍视角,手部操作商品,画面柔和 | 继续叠品牌音乐 |
| 10-15s | 商品和成品食物同框,暗示使用结果 | 结尾留品牌口号 |
这种视频对 AI 生成能力的要求更高,因为涉及光线变化和镜头移动。我的建议是:先确定“光线风格”,再用图生视频生成 3-5 秒的短视频片段,最后在剪辑软件中拼接。不要指望 AI 一次生成完整 15 秒视频。
5.4 方案三:问题解决型视频
这套方案适合有痛点的品类,比如传统秤读数不准、操作复杂。核心是前后对比。
分镜参考:
| 时间 | 画面 | 说明 |
|---|---|---|
| 0-3s | 旧秤模糊图像/混乱厨房画面 | 痛点唤起 |
| 3-6s | 商品出现,与旧场景形成对比 | 切入新品 |
| 6-10s | 操作演示,强调结果 | 功能验证 |
| 10-15s | 商品在整洁环境中的定帧画面 | 品牌强化 |
由于我们没有旧产品的实拍素材,痛点的部分可以用文字动画、漫画箭头或抽象图形来表现,不一定非要 AI 生成真实旧产品画面,这样也不会涉及侵权问题。
5.5 视频素材的提示词参考
以“手部操作电子秤”为例,图生视频的提示词可以这样写:
a hand pressing a button on a black kitchen scale, the digital display changes from 0 to 500, smooth camera motion, shallow depth of field, natural light, close-up shot, realistic style, high quality如果是镜头推近的提示词:
slow camera zoom in on a black kitchen scale placed on marble counter, morning light, cozy kitchen atmosphere, stable composition, realistic product video, no text, no watermark这里要理解的是:视频生成工具的提示词和静态图类似,但多了一个“运动描述”。你需要明确告诉模型是什么在运动、镜头怎么运动、画面节奏是快还是慢。如果视频生成工具支持起始帧和结束帧,推荐使用“首尾帧控制”,这样可以大幅提升视频稳定性。
6. 常见问题与排查思路
6.1 商品结构变形
问题现象:生成后商品形状改变,按钮位置偏移,整体结构扭曲。
常见原因:
- 重绘幅度过高,AI 有了太多自主发挥空间。
- 没有使用 ControlNet,或 ControlNet 权重过低。
- 商品本身是大面积纯色,Canny 提取不到足够的边缘信息。
排查顺序:
- 把重绘幅度降到 0.35 以下。
- 打开 ControlNet,使用 Depth 或 Canny。
- 增加 ControlNet 权重到 0.8 以上。
- 如果仍然变形,检查原始商品图的边缘是否清晰,必要时先用图像工具增强对比度。
6.2 背景元素比例失调
问题现象:生成的场景图中,桌子、杯子、水果等元素过大或过小,看起来比例奇怪。
常见原因:
- 提示词里环境词权重过高。
- 没有使用 Depth 控制景深和空间关系。
- 商品本身在画面中占比太小。
解决办法:在提示词中增加商品主体词的权重,例如用(product name:1.3)提高权重;或者用局部重绘功能,锁定商品区域,只对背景区域进行重绘。
6.3 商品上的文字变成乱码
问题现象:电子秤屏幕、包装盒、产品标签上的文字出现乱码或错误字符。
这是 AI 生成的老大难问题,尤其是模型对中文字符和精细小字的生成能力非常弱。
解决方案:
- 生成时在负面提示词中加入
text, letters, words, characters。 - 在后期修图时,将商品屏幕/标签区域重新绘制或叠加真实文字素材。
- 如果必须显示文字,建议先生成无文字的干净商品图,再用设计工具把文字贴上去。
6.4 主图白底不纯
问题现象:生成的主图底色发灰、偏黄或带轻微阴影。
亚马逊要求主图背景为纯白(RGB 255,255,255),这几乎是所有 AI 生成工具都会踩的坑。
解决方案:
- 尽量不使用 AI 生成主图,而是直接修原图。
- 如果 AI 生成后背景带灰调,使用图像处理工具把背景选中并替换为纯白。
- 不要单独依赖“white background”提示词,AI 对“绝对纯白”的理解和审核要求不同。
6.5 视频生成结果卡顿或不连贯
问题现象:图生视频生成的片段,运动过程有跳帧、闪烁或商品形变。
常见原因:
- 视频生成模型对商品细节的保持能力不足。
- 单段视频生成时长过长,模型在后期出现漂移。
- 输入的静态图分辨率不够。
建议:
- 单段视频控制在 3-5 秒,宁可多生成几段拼接,也不要一次生成 15 秒。
- 输入图分辨率提升到 1280×720 或更高。
- 在剪辑时叠加转场和音效,减轻偶发瑕疵的影响。
7. 最佳实践与工程化建议
7.1 建立提示词模板库
做电商素材不是一次性需求,而是持续、批量、可复用的需求。我强烈建议把不同类型商品、不同类型图片的提示词制作成模板,沉淀为团队资产。
模板结构可以参考:
[商品类别]_[图片类型]_[风格].txt例如:
kitchen_scale_feature_minimal.txt kitchen_scale_scene_lifestyle.txt每次做新产品时,找到对应模板,修改商品名、材质、颜色和环境词,就能快速出图,不需要从零开始写提示词。
7.2 建立种子值复用机制
在一个 Listing 项目中,6 张副图之间保持商品角度、大小一致,会让整体视觉效果更专业。为此你可以固定主图的种子值,在生成不同场景图时复用,只修改背景描述部分。
这相当于让 AI 在“同一个商品投影”的基础上换背景,而不是每次重新理解商品长什么样。
7.3 设置质量把关清单
出图后在交付前,逐项检查以下内容:
- 商品结构是否正确。
- 有无畸形部件、多余手指、错误文字。
- 有无品牌水印或版权风险元素。
- 副图是否需要预留文字区域。
- 主图背景是否为纯白。
- 图片是否符合亚马逊文件格式和尺寸要求。
7.4 保持人工审校和版权意识
AI 生成图片在版权层面仍存在许多不确定因素,尤其是跨平台模型训练数据来源。如果你生成的结果与某品牌商品高度相似,且包含对方 Logo 或特殊包装,不建议用于商业 Listing 图。安全做法是:只生成你自有品牌的商品图,或者在生成时明确屏蔽品牌词、严格控制在自有商品结构范围内。
8. 后续学习方向
如果你已经完整跑通上面的流程,可以继续往下深挖几个方向:
第一,学习局部重绘和图像扩展技巧。局部重绘可以只修改背景、只修改商品配件,是精细化控制的基础;图像扩展可以把已有的商品图扩展为 16:9 横版视频素材。
第二,学习提示词权重和采样器差异。你现在可能只会用默认采样器,但不同采样器对画面锐度、光影、细节的影响很大。花时间测一组常用采样器的效果差异,能明显提升出图质量。
第三,研究商品一致性的更进阶方案。目前社区里有通过 LoRA 微调训练商品专属模型的做法。如果你要长期做同一款产品的大量素材,可以考虑用一批商品图训练一个小 LoRA,这样生成结果的一致性会比临时写提示词高很多。
第四,搭建批处理工作流。ComfyUI 的优势在于节点化,可以把整条流程固化下来,每次换一张输入图就能批量生成 20 张候选图。这对测款和多变体产品尤其有用。
做电商素材不是靠某一次“灵感爆发”,而是靠一套可重复、可量化、可迭代的流程。希望这篇文章能帮你把单张商品图变成一套完整素材的生产链路,节省下来的时间和预算,可以放到更重要的运营环节里。如果你在实践中遇到好玩的案例或踩到新坑,欢迎按自己习惯的方式整理分享给更多卖家。