前言

制作一个精致的视频,还是需要花时间找素材,做剪辑的。

一个视频,最最重要的是它的文本内容。当然了,视觉部分也很重要。

如果,不要求制作一个精良的视频,而,仅仅希望视频可以作为文字的载体,传播文字的信息,那使用 AI 可以比较轻松的制作视频。

本文的视频制作思路,来自这个视频:

使用 AI 制作视频分为这几步:

  • 写文本
  • 将文本稿转换音频
  • 从音频生成字幕
  • 将所有材料总和起来生成视频

使用 AI 制作视频

(注:本节的所有操作,使用豆包就能完成了,不需要任何技术)

文本写作

信息类的视频,背后的文本是灵魂。原创的文本最重要。

我试着使用 AI 制作 “热点新闻列表”。但是,播放量是个位数。

  • 抖音
    • “新闻合集/素材混剪/新闻搬运式内容”,天然更容易触发低原创、同质化内容质量机制
    • 如果没有形成“有信息量、有自己编辑思路、有独创性的新视频作品”,就可能属于原创度低
  • B 站
    • B站比较适合“垂直新闻合集”,而不是“大杂烩”。

核心: 足够的输入,才能能有好的输出。AI 虽然能加快这一过程,但是人脑的输入带宽还是比较低的。在文本写作方面,AI 是一个提效的工具。如果一个视频背后的文本,一眼扫过去,感觉 AI 能一两分钟就生成,那这个文本是没有什么意义的。当然,每个人的工作和生活环境不同,知识储备方向也必然不同。

生成音频和字幕

文本写完后,使用 AI 生成音频。为什么要先制作音频?因为先制作出来的音频,是后面整个视频的尺度,控制着 AI 生成视频的进度。但是 AI 不方便直接从音频,获取到时间尺度。所以,接着使用 AI , 从音频中提取 SRT 字幕文件。字幕文件中的每句话都有时间。

现在,已经完全可以使用 AI , 克隆自己的声音了。但是,我没有克隆自己的声音,因为我的声音不好听。也不应该,未经授权,克隆别人的声音,有版权问题。所以,我直接使用 AI 软件生成音频。

AI 需要接入 TTS 服务,才能将文本转换成音频。国外的 TTS 免费额度很高,但是需要 visa 卡,有一定的支付门槛。所以,我还是建议,直接用豆包。豆包有自家的 TTS 服务。把提示词给豆包,豆包会直接生成音频,而无需关注到背后的 TTS 服务。

比如,在豆包中,使用以下提示词:

将文本转换成音频。转换成音频的同时,生成SRT字幕。
- 它是新闻类。我希望可以有一个,女性角色的中文声音,来读它。
- 声音要求:声音冷静、咬字清楚、节奏利落。
- 我们先简单的转换一小段试试。

制作视频

可以让 AI 使用 remotion , 直接将上面材料制作视频。

我更喜欢使用 Hyperframes。

先制作一个 html 文件出来。

阅读这个目录里面有 markdown 和 srt 文件。然后,制作一个 html 文件。制作它的目的,是为了我后面制作视频做准备
- 底部横向分段栏,并让每段可点击定位到对应内容
- 不要把字幕/音频加里面。
- 效果类似于漂亮的ppt,左右翻页,而不是上下滚动
- 背景使用偏明亮的颜色
- 每段新闻都是有链接的。你上这些链接去获取图片,并插入在html 的合适位置。你要识别图片,不合适的话,就别插入

然后再将 字幕,音频,html 合并成一个文件。

这个项目下面,有音频,有字幕,有html 展示文件。把它们合并成一个视频。
- 使用 WAV文件作为音频;把完整 SRT 作为唯一时间轴;每条字幕对应的新闻内容在对应时间段展示;
- 页面切换、字幕、配图、进度动画都由 Hyperframes 控制。
- 当前电脑硬件比较好,你可以加速并行运行。但是绝不能为了速度降低质量。质量最重要。

相关链接

  • RVC-Boss/GPT-SoVITS : 克隆自己的声音(我试了下,挺有意思的)
  • TTS(Text-to-Speech, 文本转语音)-火山引擎: 提供了TTS API。但是现在还没有一款合适的MCP/SKILL 来接入
  • chidiwilliams/buzz: : 从音频里面提取 SRT 字幕,我安装了,不知道为啥运行会闪退。(剪映也集成了提取字幕的功能,但是收费) (后来,直接把音频扔个豆包,让豆包自己先办法提取字幕,也能提取,就是时间稍微有一点点偏)
  • Gemini Notebook : 文字生音频/视频,可以试试
  • remotion-dev/remotion : 每一帧都是一个 React 组件,每一个动画都是一个 JS 函数