CASE STUDY / LOCAL VIDEO PIPELINE

小猫讲知识

一套把 AI 知识短视频做成可审查生产线的本地工作流。它不追求“自动生成就结束”,而是让每个环节都能被检查、拦截和重做。

45 秒知识视频真实音频时间线本地渲染与质检
戴眼镜、带问号气泡的小猫角色,表示从问题开始

THE PROBLEM

自动化的价值,不是把视频做得更快。

真正困难的是:在批量生产时,仍然让每一句话、每一段画面、每一秒音频都维持可解释的质量。这个工作流把“生成”拆开,也把每一个容易失控的环节拆开。

01 / 语义

先明确视觉意图。

每段文案先说明关系、角色、道具、动作和黑板文字,而不是只拿关键词去猜素材。

02 / 资产

让风格可以复用。

从注册素材库挑选已经验证的小猫、道具和布局,减少临时生图造成的画风漂移。

03 / 时间

让真实时长说话。

配音和字幕以实际音频为准;不为了凑时长而慢放、拉伸或伪造节奏。

THE PIPELINE

八道步骤,八个可检查的点。

这不是一个黑箱式的“一键出片”按钮。每个节点都有确定输入、明确输出,以及可以定位问题的检查标准。

01 / INPUT

确认选题与文案

输入标题、确认的口播文案、风格包和素材库。

02 / REVIEW

脚本与字幕审查

检查字数、语速、字幕断句和容易引发异常配音的拟声词。

03 / STORYBOARD

分镜与视觉意图

定义谁出现、拿什么道具、怎么动,以及画面是否需要显示文字。

04 / ASSETS

选择注册资产

从已验证的小猫、道具和布局中挑选,保证视觉语法保持一致。

05 / VOICE

配音与字幕对齐

豆包逐段合成原速语音,再用 Faster-Whisper 写出真实字幕时间轴。

06 / RENDER

Remotion 本地渲染

根据真实音频时间线合成画面、字幕、音效和 BGM。

07 / QC

自动质检

检查资产缺失、字幕偏差、音画同步与音频削波等问题。

08 / HUMAN

人工审核发布

保留“通过 / 重做 / 发布”三种明确结果,作为最后一道质量门。

23s一次被正确拦截的测试

不把 23 秒文案慢放,硬凑成 30 秒。

上次测试中,系统发现文案对应的真实配音只有 23 秒。它没有把音频拉慢来伪装时长,而是拦截该结果,等待重新调整文案或时长。这件小事说明:工作流判断“合格”的依据是内容和时间线,而不是只要没有报错。

AUTOMATION BOUNDARY

自动化处理重复,人负责判断好坏。

这条边界是项目的一部分。把所有事都交给模型并不等于效率;真正可用的流程需要保留人工负责的判断门。

ALREADY AUTOMATED

系统稳定完成的事

  • 分镜结构与已注册资产筛选
  • 配音、字幕对齐、BGM 与本地渲染
  • 自动质检、文件输出与异常检查

HUMAN JUDGMENT

仍然必须由人判断的事

  • 选题角度与文案质量
  • 视觉意图是否真正贴合语义
  • 新风格、新素材需求与审美问题
  • “没报错,但不好看”的情况

TECH STACK

在本机跑起来的组合,而不是概念图。

编排、生成、对齐、渲染与检查都在本机 PowerShell / Python 脚本和 Remotion 本地渲染环境中完成。

ORCHESTRATIONPython + JSON Schema

负责流程编排、结构校验与数据约束。

VIDEOReact / TypeScript / Remotion

按照真实音频时间线组织和渲染视频画面。

MEDIAFFmpeg / FFprobe

承担视频与音频的底层处理、读取与检查。

VOICE火山引擎豆包语音

按原速逐段生成配音。

CAPTIONSFaster-Whisper

在本地写出与真实语音对齐的字幕时间轴。

ASSETS图片 API + JSON 注册表

补功能型资产,并通过视觉语法规则维持一致性。