面向数字人呈现的生成式媒体核心:双引擎 TTS 语音合成、音色管理、字级语音-文本强制对齐与字幕 / 口型驱动的视频合成。

Part of AI 教学视频生成平台 本模块负责数字人语音与媒体呈现(Digital Presentation)。
一个面向数字人风格视频的生成式媒体流水线:TTS 语音合成、受控音色、字级语音-文本强制对齐与视频合成——这是驱动数字人内容的语音与对齐核心。
数字人视频需要三个紧密耦合的部分:可信的合成语音、音频与文本之间的精确对齐(用于字幕与口型同步)、以及视频合成。本项目构建这一生成式媒体核心,并保证生产级可靠性。
本项目聚焦数字人的呈现驱动核心——可信语音、精确对齐与视频合成;课程内容如何自动生产,参见 AI 课程自动生产系统。两个项目共享底层 TTS 与对齐能力,边界清晰:一个解决「课程内容生产」,一个解决「AI 教师呈现」。
构建模块化的生成式媒体流水线:
讲稿文本 → TTS 语音合成 → 字级强制对齐 → 字幕 / 口型驱动 → 视频合成导出

不同内容对音色与风格的要求不同,单引擎方案天花板明显:
正确的字幕与自然的口型同步都以精确时间戳为前提:
各阶段为模块化流水线任务,带断点管理与中间结果缓存,可在 GPU 推理环境稳定部署。
输入:讲稿文本 + 音色配置
输出:配音 + 字 / 词级时间戳 + 数字人风格视频(MP4)
双引擎 TTS 统一封装,多音色 / 语速可控
字级语音-文本强制对齐时间戳输出
字幕与口型驱动链路打通
多 GPU、可断点续跑的批量执行
视频合成与 MP4 导出
流水线生成带对齐字幕的配音,驱动数字人风格视频,并合成导出最终 MP4。
语音:CosyVoice 3 · IndexTTS 2.5 · 多音色管理 对齐:FunASR (Paraformer) · VAD · 字 / 词级时间戳 视频:FFmpeg · 视频合成 工程:Docker · GPU 推理 · 断点流水线
设计并构建生成式媒体流水线:
该项目完整体现了我从 生成式语音模型集成、字级语音-文本强制对齐到多模态视频合成落地 的多模态 AI 工程能力。
当前「语音 → 对齐 → 合成」核心链路已可运行,其模块化设计具备向更完整数字人产品延展的空间: