自动语音识别(ASR)模型通过实现字幕和翻译的生成,彻底改变了视频内容的可访问性。这些模型利用先进的算法以高准确度将口头词汇转录为文本。通过将 ASR 技术集成到视频平台中,内容创作者、发布商和分发商可以吸引更广泛的受众,包括听力障碍人士或那些更喜欢使用不同语言消费内容的人。
该流程首先是从视频源中捕获音频,然后将其输入到 ASR 模型中。该模型分析音频波形并将其转换为文本表征,以字幕的形式捕获口头内容。此外,您还可以使用 ASR 模型进行语言翻译,从而能够创建多语言字幕。生成字幕后,它们可以与视频一同显示,从而提供口头内容的同步文本表征。
- 客户端上传:向 API 端点发送包含视频和音频的 POST 请求。
- 音频转录:通过以音频作为输入调用 Workers AI 自动语音识别(ASR)模型来生成带有时间戳的转录文本。使用 Workers 将输出转换为支持的字幕格式。
- 存储字幕:将字幕文件存储在 R2 上。
- 存储视频:将视频文件存储在 R2 上。
- 客户端请求:向源站发送针对视频和字幕的 GET 请求。使用全局缓存(Cache)以提高性能。
- 源站请求:在缓存未命中(
MISS)时,使用公共存储桶(Public Buckets)从 R2 获取文件。