持续迭代

AI 课程自动生产系统

面向教育内容生产的多模态 AI 平台,将课程 PPT 自动转化为完整讲解视频,覆盖 LLM 讲稿生成、双引擎 TTS、字级语音-文本强制对齐与自动视频渲染。

角色 独立 AI 工程师
周期 2026.08 - 至今
团队 1 人
LLM CosyVoice 3 IndexTTS 2.5 FunASR FFmpeg Gradio Docker GPU 推理
AI 课程自动生产系统
核心亮点
  • 双模式生产:PPT 自动讲稿,或已有讲稿直接配音
  • CosyVoice 3 + IndexTTS 2.5 双引擎 TTS,支持音色克隆与多 GPU 并行
  • 基于 ASR 字词时间戳与讲稿匹配的强制对齐字幕
  • 断点续跑与失败恢复,支撑长批次课程稳定生产

Part of AI 教学视频生成平台 本模块负责课程内容生产(Content Generation)。

一个将课程 PPT 自动转换为完整讲解视频的 AI 课程生产平台,覆盖内容生成、语音合成、对齐与视频合成全流程,把原本割裂的人工环节整合为一条可规模化的自动生产线。

项目概述

传统课程视频制作通常需要教师依次完成:教学内容整理 → 课程讲稿编写 → 配音录制 → 字幕制作 → 视频剪辑。整个流程人工成本高、周期长,难以规模化生产。

本项目设计并实现了一套 AI 驱动的课程自动生产平台,通过大语言模型、神经语音合成、语音文本对齐与自动化视频渲染技术,实现从课程素材到完整教学视频的自动生成。

系统支持两种生产模式:

  • 自动讲稿模式:无现成讲稿时,由 LLM 理解 PPT 并完成讲稿生成,经 LLM-as-Judge 质量审查后进入语音与视频生产。
  • 直接配音模式:已有课程文本时,跳过讲稿生成,直接进行 TTS 语音合成、字幕对齐与视频渲染。

两种生产模式

自动讲稿模式

课程 PPT → 内容理解 → LLM 讲稿生成 → LLM-as-Judge 讲稿审查 → TTS 语音合成 → 字幕对齐 → 课程视频

适用于没有现成讲稿的新课程制作:系统从 PPT 中理解页面结构、知识点关系与教学上下文,由 LLM 完成讲稿生成;再由 LLM-as-Judge 审查模块检查页面衔接、内容重复与表达质量,问题片段局部重写,合格后才进入语音与视频生产。

直接配音模式

已有课程文本 → TTS 语音合成 → 字幕对齐 → 课程视频

适用于已有教学内容快速数字化:直接对既有文本进行语音合成与字幕对齐,跳过讲稿生成环节,显著缩短生产链路。

系统架构

下图展示了 AI 课程自动生产的核心 Pipeline。该流程不包含数字人,每个模块均属于当前项目自身能力,技术边界清晰。

AI 课程自动生产 Pipeline

核心链路为:

课程 PPT → PPT 解析与内容理解 → LLM 讲稿生成 → LLM-as-Judge 讲稿审查
        → TTS 语音合成 → 字级对齐 → 视频渲染 → 课程视频

核心技术挑战

高自然度 TTS 语音合成与生产可靠性

项目集成多种神经语音合成模型:CosyVoice 3IndexTTS 2.5,并构建统一 TTS 推理接口,实现音色克隆、多音色管理、语速控制与批量生成。

针对长课程生产场景,进一步实现:

  • 多 GPU 并行:将独立生成任务分配至不同 GPU,提高批量课程生产效率。
  • 失败恢复:单任务异常不影响整体批次。
  • 断点续跑:已完成的阶段结果可复用,无需整体重跑。

保证大规模课程生成任务稳定运行。

字级语音-文本强制对齐与精准字幕生成

传统字幕通常根据文本长度估计时间,容易造成字幕提前、语音不同步或长句显示异常。

系统以 VAD + FunASR Paraformer 识别出的字词发音时间为锚,经文本匹配将时间戳逐字映射回讲稿,实现字级语音-文本强制对齐,生成精准字幕数据,显著提升字幕与语音的同步准确性。

基于 LLM 的课程质量分析与优化

针对 AI 自动生成讲稿可能存在的页面衔接不足、内容重复、表达机械等问题,在讲稿生成之后引入基于 LLM-as-Judge 的讲稿审查模块,对生成内容进行自动检查,支持:

  • 全局课程逻辑检查
  • 问题分类
  • 局部内容重写

持续提升 AI 生成课程的教学质量与连贯性。

工程实现

模块化 AI Pipeline

系统采用任务流水线架构,每个阶段支持状态管理、中间结果缓存、失败恢复与阶段重新执行:

Pipeline
├── PPT Parser
├── Script Generator
├── TTS Worker
├── Alignment Worker
├── Subtitle Generator
└── Video Renderer

部署架构

基于 Gradio Web UI 提供交互入口,由 Pipeline Controller 统一调度 LLM、TTS 与对齐三类推理 Worker,运行于 GPU 推理运行时,最终完成视频渲染。

GPU 推理部署架构

项目成果

完成端到端 AI 课程自动生产流程:

  • 输入:课程 PPT
  • 输出:完整课程视频 + AI 生成讲解声音 + 精准同步字幕

系统已实现:

  • PPT 内容自动理解
  • LLM 教学讲稿生成
  • 高自然度语音合成
  • 字级语音文本对齐
  • 自动字幕生成
  • 视频自动渲染
  • 长任务断点恢复

技术栈

生成式 AI:LLM · Prompt Engineering · 内容理解与生成 语音 AI:CosyVoice 3 · IndexTTS 2.5 · FunASR Paraformer · VAD 多模态处理:Speech-Text Alignment · Subtitle Generation · FFmpeg 工程:Python · Gradio · Docker · GPU 推理 · Pipeline Workflow

我的贡献

独立完成系统设计与开发:

  • 设计 AI 课程自动生产整体架构
  • 构建 PPT → 视频端到端生成 Pipeline
  • 集成多种神经语音生成模型
  • 实现字级语音-文本强制对齐系统
  • 开发 LLM 课程内容分析与优化模块
  • 完成 GPU 推理环境与 Docker 工程部署

该项目完整体现了我从 AI 模型研究与算法开发、生成式模型集成,到多模态 AI 应用架构设计与工程化落地 的端到端能力。

应用前景与可扩展方向

当前系统已跑通"PPT → 课程视频"的端到端链路。在此之上,其模块化架构与多模型能力具备向更广场景延展的潜力:

应用场景

  • 企业内训与职业教育:将产品资料、制度文档、技术手册快速转化为带讲解的视频课程,降低培训内容生产门槛。
  • 知识库驱动的课件更新:源文档或 PPT 变更时,可增量重生成对应课程片段,保持教学内容与知识库同步。
  • 多语言课程出海:结合翻译管线与多语种 TTS 音色,将同一套课程批量生成为多种语言版本。
  • 大规模在线课程生产:为教育机构与内容平台提供"内容工厂"能力,把零散素材批量转为标准化教学视频。

可扩展技术方向

  • 数字人讲师:复用本项目的语音合成与字级对齐能力,叠加数字人驱动,形成有形象、可交互的课程讲解。
  • 互动式课程与测评:从"视频"延伸到配套讲义、知识点测验与课程知识图谱,构建完整学习闭环。
  • 平台化内容工厂:引入多租户、任务队列与质量 / 成本看板,将单机流水线演进为可规模运营的课程生产平台。
  • Agent 化生产编排:以 AI Agent 统筹多阶段生产,自主完成自检、修订与迭代,进一步提升自动化与一致性。