先明确视觉意图。
每段文案先说明关系、角色、道具、动作和黑板文字,而不是只拿关键词去猜素材。
CASE STUDY / LOCAL VIDEO PIPELINE
一套把 AI 知识短视频做成可审查生产线的本地工作流。它不追求“自动生成就结束”,而是让每个环节都能被检查、拦截和重做。
THE PROBLEM
真正困难的是:在批量生产时,仍然让每一句话、每一段画面、每一秒音频都维持可解释的质量。这个工作流把“生成”拆开,也把每一个容易失控的环节拆开。
每段文案先说明关系、角色、道具、动作和黑板文字,而不是只拿关键词去猜素材。
从注册素材库挑选已经验证的小猫、道具和布局,减少临时生图造成的画风漂移。
配音和字幕以实际音频为准;不为了凑时长而慢放、拉伸或伪造节奏。
THE PIPELINE
这不是一个黑箱式的“一键出片”按钮。每个节点都有确定输入、明确输出,以及可以定位问题的检查标准。
输入标题、确认的口播文案、风格包和素材库。
检查字数、语速、字幕断句和容易引发异常配音的拟声词。
定义谁出现、拿什么道具、怎么动,以及画面是否需要显示文字。
从已验证的小猫、道具和布局中挑选,保证视觉语法保持一致。
豆包逐段合成原速语音,再用 Faster-Whisper 写出真实字幕时间轴。
根据真实音频时间线合成画面、字幕、音效和 BGM。
检查资产缺失、字幕偏差、音画同步与音频削波等问题。
保留“通过 / 重做 / 发布”三种明确结果,作为最后一道质量门。
上次测试中,系统发现文案对应的真实配音只有 23 秒。它没有把音频拉慢来伪装时长,而是拦截该结果,等待重新调整文案或时长。这件小事说明:工作流判断“合格”的依据是内容和时间线,而不是只要没有报错。
AUTOMATION BOUNDARY
这条边界是项目的一部分。把所有事都交给模型并不等于效率;真正可用的流程需要保留人工负责的判断门。
ALREADY AUTOMATED
HUMAN JUDGMENT
TECH STACK
编排、生成、对齐、渲染与检查都在本机 PowerShell / Python 脚本和 Remotion 本地渲染环境中完成。
负责流程编排、结构校验与数据约束。
按照真实音频时间线组织和渲染视频画面。
承担视频与音频的底层处理、读取与检查。
按原速逐段生成配音。
在本地写出与真实语音对齐的字幕时间轴。
补功能型资产,并通过视觉语法规则维持一致性。