大多数教程一次只讲一个功能。这篇不一样:它讲解如何把三种不同的模式——文字转语音、图片转视频和直接发布——串联成一个完整流程,将一张照片和一段文字脚本变成已发布的视频,全程不需要碰传统视频编辑器。
为什么要串联多个模式,而不是单独使用
每个模式单独使用时只解决一个具体问题。串联起来,它们能解决一个更大的问题:从"我有一张照片和想说的话"直接到"已经发布在 TikTok 上",中间不需要在不同工具之间导出再导入文件。
第一步——写脚本并生成配音
从文字转语音开始。写下你想表达的内容——最多 5000 字符——然后选择语言(支持 20 种)、音色(男声或女声)和语速(正常或慢速,适合内容较密集或需要保持清晰的专业脚本)。输出结果是一个干净的 MP3 文件,可以直接用作旁白。
保持脚本口语化,只保留真正需要说的内容——配音内容太密集反而比略微精简的更难跟上,尤其是在很多人有时会静音观看的平台上。
第二步——用这段配音把照片变成视频
把第一步生成的 MP3 与一张图片搭配,使用图片转视频功能。由于视频时长会自动锁定音轨长度,你不需要手动做任何时间对齐——视频时长会正好等于你的配音时长。
这一步有几个值得注意的选择:
- 启用动效(Ken Burns 效果适合大多数图片),这样配音播放时照片不会一直静止不动。
- 如果脚本中有值得视觉强调的关键句,可以添加逐字显示的文字叠加,让文字出现节奏大致跟随语音。
- 如果目标是 TikTok 或 Reels 这类竖屏格式,而原图不是竖版,可以选择"cover"适配模式。
第三步——直接发布
视频生成后,直接从同一界面发布到你已连接的 TikTok 和/或 YouTube 账号——无需下载,无需手动重新上传。设置好文案,选择隐私级别,就完成了。
什么情况下适合用这个流程
这套串联流程特别适合:
- 公告和引言 ——一张有冲击力的图片配一段简短的语音信息,快速发布。
- 产品亮点展示 ——一张产品照片,配一段简短的语音介绍,无需任何实拍即可发布。
- 重复性内容形式 ——一旦确定了风格(相同的适配模式、相同的动效、相同的音色),每次只需替换照片和脚本,重复这个流程就会很快。
常见问题
每次都必须用完这三个步骤吗?
不需要——每个模式都可以独立使用。这个流程只是在你没有实拍素材、但有一张照片和想说的话时的一种建议做法。
可以用我自己录制的声音代替文字转语音吗?
可以——图片转视频接受任何 MP3 文件,无论是文字转语音生成的还是你自己录制的。文字转语音只是省去了手动录制和剪辑旁白的步骤。
如果我想合并多张照片而不是一张呢?
为每张照片分别生成一段图片转视频输出(每段配上各自的简短配音),然后在发布前用融合(fusion)模式把这些片段合并在一起。