面向教育内容生产的多模态 AI 平台,将课程 PPT 自动转化为完整讲解视频,覆盖 LLM 讲稿生成、双引擎 TTS、字级语音-文本强制对齐与自动视频渲染。

Part of AI 教学视频生成平台 本模块负责课程内容生产(Content Generation)。
一个将课程 PPT 自动转换为完整讲解视频的 AI 课程生产平台,覆盖内容生成、语音合成、对齐与视频合成全流程,把原本割裂的人工环节整合为一条可规模化的自动生产线。
传统课程视频制作通常需要教师依次完成:教学内容整理 → 课程讲稿编写 → 配音录制 → 字幕制作 → 视频剪辑。整个流程人工成本高、周期长,难以规模化生产。
本项目设计并实现了一套 AI 驱动的课程自动生产平台,通过大语言模型、神经语音合成、语音文本对齐与自动化视频渲染技术,实现从课程素材到完整教学视频的自动生成。
系统支持两种生产模式:
课程 PPT → 内容理解 → LLM 讲稿生成 → LLM-as-Judge 讲稿审查 → TTS 语音合成 → 字幕对齐 → 课程视频
适用于没有现成讲稿的新课程制作:系统从 PPT 中理解页面结构、知识点关系与教学上下文,由 LLM 完成讲稿生成;再由 LLM-as-Judge 审查模块检查页面衔接、内容重复与表达质量,问题片段局部重写,合格后才进入语音与视频生产。
已有课程文本 → TTS 语音合成 → 字幕对齐 → 课程视频
适用于已有教学内容快速数字化:直接对既有文本进行语音合成与字幕对齐,跳过讲稿生成环节,显著缩短生产链路。
下图展示了 AI 课程自动生产的核心 Pipeline。该流程不包含数字人,每个模块均属于当前项目自身能力,技术边界清晰。
核心链路为:
课程 PPT → PPT 解析与内容理解 → LLM 讲稿生成 → LLM-as-Judge 讲稿审查
→ TTS 语音合成 → 字级对齐 → 视频渲染 → 课程视频
项目集成多种神经语音合成模型:CosyVoice 3 与 IndexTTS 2.5,并构建统一 TTS 推理接口,实现音色克隆、多音色管理、语速控制与批量生成。
针对长课程生产场景,进一步实现:
保证大规模课程生成任务稳定运行。
传统字幕通常根据文本长度估计时间,容易造成字幕提前、语音不同步或长句显示异常。
系统以 VAD + FunASR Paraformer 识别出的字词发音时间为锚,经文本匹配将时间戳逐字映射回讲稿,实现字级语音-文本强制对齐,生成精准字幕数据,显著提升字幕与语音的同步准确性。
针对 AI 自动生成讲稿可能存在的页面衔接不足、内容重复、表达机械等问题,在讲稿生成之后引入基于 LLM-as-Judge 的讲稿审查模块,对生成内容进行自动检查,支持:
持续提升 AI 生成课程的教学质量与连贯性。
系统采用任务流水线架构,每个阶段支持状态管理、中间结果缓存、失败恢复与阶段重新执行:
Pipeline
├── PPT Parser
├── Script Generator
├── TTS Worker
├── Alignment Worker
├── Subtitle Generator
└── Video Renderer
基于 Gradio Web UI 提供交互入口,由 Pipeline Controller 统一调度 LLM、TTS 与对齐三类推理 Worker,运行于 GPU 推理运行时,最终完成视频渲染。
完成端到端 AI 课程自动生产流程:
系统已实现:
生成式 AI:LLM · Prompt Engineering · 内容理解与生成 语音 AI:CosyVoice 3 · IndexTTS 2.5 · FunASR Paraformer · VAD 多模态处理:Speech-Text Alignment · Subtitle Generation · FFmpeg 工程:Python · Gradio · Docker · GPU 推理 · Pipeline Workflow
独立完成系统设计与开发:
该项目完整体现了我从 AI 模型研究与算法开发、生成式模型集成,到多模态 AI 应用架构设计与工程化落地 的端到端能力。
当前系统已跑通"PPT → 课程视频"的端到端链路。在此之上,其模块化架构与多模型能力具备向更广场景延展的潜力: