详情

首页手游攻略 cutscene-reel:实践指南

cutscene-reel:实践指南

佚名 2026-10-07 10:20:01

在项目中评估cutscene-reel,可以先看清用途边界:代理技巧:将一张产品照片变成游戏过场风格的有声视频广告。把它放到视频制作流程中,最容易暴露的是素材、节奏、编码和最终画面容易不一致,不能只看演示是否顺利。落地前可以拿一组已有素材完成一段短样片,用素材路径、渲染结果、音画同步和导出格式判断它是否真的省事。如果团队属于有真实素材并需要稳定视频产出的创作者,它有继续测试的理由;否则先看替代方案会更省时间。

名称:过场动画 描述:制作一个 25-35 秒的“游戏过场动画”产品广告 - 一个风格化的 3D 角色穿着或拿着用户的真实产品,在现场发表冷酷有趣的事实咆哮,在产品上打出一个妙语,并切入真实的产品照片和 URL。当用户请求 AI 角色广告、游戏过场动画/PS2-style 卷轴、会说话的角色产品视频、“与 T 恤中的游戏角色一起疯传的视频”,或者想要将产品照片转换为 图像社交平台、TikTok 或 X 的简短视频广告时使用。

过场动画卷轴

将一张产品照片变成“视频游戏过场动画”格式的简短的会说话的人物广告。

你是导演。脚本负责生成;你做出创造性的决定,审查每一个 框架表,并重新生成错误的内容。大多数第一次拍摄都需要一两个修复。

格式是什么

节拍 时间 射击 职位
挂钩(可选) 0-4秒 无声的行动 停止滚动:演讲前的一个时尚小动作
1号线 2-5秒 媒介、手势 令人惊讶的“你知道吗”事实或“有趣的是”观察
2号线 3-5秒 宽大、全套装备 解释一下。显示整体外观和位置
3号线 5-7秒 特写 笑话。狡猾、面无表情
4号线 3-5秒 中等,指向产品 产品的变化
端卡 3-4秒 真实产品照片 “在 <url> 获取您的。生物链接。”

使其发挥作用的规则:一个角色、一个位置、取自产品的两种颜色的灯光, 一个干巴巴的声音,大约每分钟 150 个单词,一张安静的低保真床,白色的小写字幕,每一个剪辑 4-6秒,最后以实物照片展示实物。完整细分: references/format.md.

开始之前

询问用户是否缺少任何内容。不要猜测产品或 URL。

  1. 产品:2-3 张照片(一张是模特或平面照片,一张是打印特写)以及最后一张卡片的 URL。
  2. 角色:谁在说话。默认为您设计的原始角色。请参阅下面的“权利”。
  3. 位置:光线与产品的两种主要颜色相匹配的地方。
  4. 角度:真实的事实或观察,以及它如何落在产品上。
  5. 密钥:环境中的 GEMINI_API_KEY 和 ELEVENLABS_API_KEY 或环境中的 .env 文件 工作文件夹。切勿打印密钥或提交 .env。

路径上需要带有 Pillow (pip install pillow) 和 ffmpeg 的 Python 3。

管道

在新的项目文件夹中工作。下面的S是该技能的scripts/文件夹。

1. 脚本

写 4 行,每行 8-16 个字,加上尾卡行。小写态度,没有主题标签,没有炒作。 检查每一个事实。将 examples/project.json 复制到 project.json 并填写各行。

2. 关键帧(每次拍摄一张图像,16:9)

python S/gen_image.py shots/k1_medium.png 16:9 "<prompt>" product/on_model.jpg product/print.jpg
  • 首先进行中景。看看它。修复它,直到角色和产品正确为止。
  • 从该图像作为参考生成每个其他关键帧(“相同的确切字符,相同的 位置,仅新的拍摄角度”)。这就是在不同镜头中保持脸部相同的原因。
  • 风格、人物、广角、特写和定点镜头的提示模板:references/prompts.md。

3. 动画

python S/make_shots.py project.json

每个镜头都成为 runs/<name>/out/ 中带有语音和口型同步的 10 秒剪辑。然后对于每个剪辑:

python S/sheet.py runs/<name>/out/s1.mp4

并阅读纸张图像。如果出现以下情况,则拒绝并重新生成(删除.mp4,调整action,重新运行):

  • 面部、肤色或头发从关键帧发生变化;
  • 相机在应该固定的时候推入或切入;
  • 产品打印变成乱码(当角色离开相机时常见)。

4. 语音

python S/voice.py project.json

使用单词时间戳转录每个剪辑,并将语音转换为一个 ElevenLabs 语音 语音到语音,保持时间同步,从而保持口型同步。标记为 CHECK 的行与 脚本:读取它们,如果单词丢失,则重新生成剪辑。小成绩单(? 为 .、47(对于 forty-seven)可以通过编辑 out/sN_stt.json 来修复,因为字幕是根据它构建的。

5. 音乐

python S/music.py music/bed.mp3

生成原始低保真床。将project.json中的"music"设置为它。

6. 构建

python S/build.py project.json

将每个镜头修剪成其语音,裁剪为 4:3,放大到 1440x1080,刻录字幕,添加结尾 卡,混合音乐配音。输出:final/<name>.mp4。

7. 检查

python S/qc.py final/<name>.mp4
python S/sheet.py final/<name>.mp4 1

您无法听到视频。 qc.py具有模型手表和侦听和报告语音一致性, 口型同步、字幕和连续性问题。阅读它和表格,修复他们发现的内容,并告诉 用户清楚地了解模型检查的内容与他们仍需要自己观察的内容。

钩子

第 1 行之前的无声动作镜头延长了观看时间。添加一个带有 "silent": true 的镜头,它自己的 "prompt",并在审查其工作表后 "trim": [start, end] 和 "speed" (1.5-1.75 作品)所以 3-5 秒后着陆。有效的例子:涂口红、合上粉盒以及 对着镜头飞吻;扔出扳手,抓住它并将其指向相机。保留产品 在快速运动期间打印出框或大框,否则会出现污点。

当一代人被封锁时

视频模型拒绝一些提示。效果如何:

  • 第三方内容块:关键帧显示可读的品牌徽标,或文字名称 品牌。重新措辞 action 而不命名服装,或使用徽标较小的关键帧。 重试同一请求有时会通过。
  • 安全阻止:软化身体接触或暗示性措辞(镜头上的亲吻被阻止; 对着镜头飞吻过去)。
  • 503/高需求:等待并重新运行;已完成的剪辑将被跳过。

使用其他型号

各个阶段是独立的。交换其中任何一个并保留文件契约:

  • 关键帧:任何接受参考图像的图像模型。保存shots/<id>.jpg。
  • 动画:任何生成语音的图像到视频模型。保存runs/<name>/out/<id>.mp4。 如果模型没有语音,请生成文本转语音的行并使用唇形同步模型。
  • 语音:任何语音转语音以及任何返回单词时间戳的转录器 {"words":[{"text","start","end","type":"word"}]} 为 out/<id>_stt.json,语音为 out/<id>_vo.mp3。
  • build.py 只需要这些文件加上 project.json。

权利(发布前请阅读此内容)

  • 角色:设计一个原创角色。请勿重新创建游戏、电影中可识别的角色 或其他创作者的帐户,甚至“以……的风格”。
  • 产品和品牌:仅展示用户拥有或有权使用的产品和徽标。
  • 音乐:生成它或许可它。请勿从其他人的视频中提取音频。
  • 事实:验证它们。错误的“你知道吗”会在评论中得到纠正。
  • 告诉用户他们的请求是否超出其中之一,并提供干净的替代方案。
相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载