AI 工具与知识库 · 第 4 篇

图像、视频与音频工作流

从需求、素材和规格出发,建立可复现的多媒体制作流程。

30 分钟内容实战

学完能做什么

你会把一个信息目标拆成文案、画面、旁白、音效和剪辑任务,用参考规范保持一致,并在生成前后检查授权、人物、文字和事实。

先做决策,再做媒体

无限换描述、反复生成,通常是因为前面没有锁定五件事:

  1. 说给谁看;
  2. 他看完要知道什么或做什么;
  3. 时长和画幅是什么;
  4. 不能改的事实、品牌和人物特征是什么;
  5. 哪些素材有权使用。

一条可控的媒体流程

text
信息卡 → 脚本 → 分镜表 → 风格规范
       → 生成图像/视频/语音 → 剪辑组装
       → 事实、文字、连续性、音量与授权检查

生成只是中间一步,不是整个任务。

用分镜表管理信息

镜头时长画面任务旁白屏幕文字连续性要求
10–4s展示使用场景和问题一句问题不超过 12 字主角衣着 A
24–10s展示操作步骤两个动作步骤 1、2屏幕方向一致
310–16s给出结果和检查点一句结论交付物名称与前景光线一致

分镜表里的文字是信息真相源,不要让画面生成工具自由改写数字和品牌文案。

图片生成:先描述功能,再描述风格

一个完整的画面说明包含:

  • 主体和关键动作;
  • 环境、时间和构图;
  • 品牌色、镜头感和材质;
  • 必须保留的人物或产品特征;
  • 明确不要出现的错误元素;
  • 交付尺寸和后续裁切安全区。

图里的长文字建议在排版阶段添加,不要依赖生成画面的模型准确写字。

视频生成:一次只控制一段连续动作

短镜头比一次要求完成复杂叙事更容易检查。每个镜头定义:开始画面、主动作、结束画面、镜头运动和不能变的对象。

人物一致性要用角色卡管理:年龄区间、发型、衣着、颜色、道具和不得变化的特征。每次生成后逐镜检查,不要等剪完才发现主角变了人。

音频与旁白:可听懂比声线炫技更重要

旁白先做口语化处理:短句、明确停顿、数字读法统一、专有名词有发音标记。生成后检查:

  • 语速是否超过画面理解速度;
  • 人名、数字、英文缩写是否读对;
  • 配乐是否遮盖人声;
  • 音量、底噪和片段连接是否突兀;
  • 声音素材和模仿对象是否获得授权。

媒体交付的五轮检查

  1. 事实:屏幕文字、旁白、数字和画面含义一致。
  2. 连续性:人物、服饰、产品、方向、光线和时间不跳变。
  3. 可读可听:手机尺寸文字仍可读,旁白和配乐仍清楚。
  4. 技术:分辨率、帧率、字幕时间、音量和编码符合交付平台。
  5. 权利:人像、声音、字体、音乐、参考图和品牌素材使用范围明确。

分镜练习

为“如何把会议纪要变成待办”设计一个 20 秒视频:

  • 先写一句受众和动作目标;
  • 限定为 4 个镜头;
  • 每镜只有一个动作和一条屏幕文字;
  • 写角色卡和一致性要求;
  • 写旁白,并手动读一遍计时;
  • 列出你将如何检查授权。

先完成分镜表,不必立即生成画面。如果分镜表还不能说清信息,生成只会把问题变得更贵。

完成检查清单

  • 受众、信息目标、时长和画幅已锁定。
  • 分镜表是屏幕文字和旁白的事实源。
  • 人物、产品和风格有可检查的规范。
  • 长文字在排版阶段添加,不依赖画面随机生成。
  • 事实、连续性、可读可听、技术和权利已分别检查。

下一篇

《智能编程工具适合做什么》——把“会写代码”变成可审查、可测试的仓库工作流。