剧集高光切片引擎

把一集正片自动切成可发布的短视频:机器批量生产候选,人只做最后一道创意终审。

问题

剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。 一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠。

瓶颈不在剪辑工具,在"找"。剪的部分早就有成熟软件,找的部分至今没有。

为什么开源方案解不了

市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。 这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。

剧集不是这样。剧集的爆点在画面里:打斗、反转、告白、名场面。 把开源逻辑照搬到剧集上,结果是可预期的——找到一堆话密的片段,漏掉所有名场面

所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品, 直接用就好。唯独"这一段算不算高光"这个判断,没有任何开源项目替你回答。 这也是我们唯一自研的部分。

架构

三路识别并行跑,在一个可解释的加权判定处收敛:

转码 · 镜头分割
      │
      ├──→ 台词转写      情绪强度 · 金句
      ├──→ 画面理解      动作强度 · 场景标签
      └──→ 人脸追踪      主演在场
                │
                ▼
        高光判定引擎  ★ 唯一自研
                │
      ┌─────────┴─────────┐
      ▼                   ▼
  切片渲染            封面与文案

判定用的是可解释的加权规则,不是黑盒模型。四路信号各自的贡献分开呈现, 权重外置在配置文件里——现场能当场调、秒级重算,不必重跑上游识别。 这在演示和调优时的价值,远大于多几个百分点的准确率。

工作台

整条链路的产物最终落到一个本地网页里。设计上只服务一件事: 让「这一段算不算高光」这个判断变快。人不再从零开始剪,而是对机器的候选做取舍。

新建切片任务页
① 新建任务。从服务器已有素材里选片,不做上传—— 一集正片 2–3GB,经浏览器传没有意义,而且介质本就不该离开这台机器。 输出提示选项会改变四路信号的权重侧重。
处理进度页
② 处理进度。六个阶段各自报告用了什么工具、产出了什么。 任一环节失败会自动降级并继续,不中断整条链路——现场演示最怕的是中途报错停住。
候选复核页
③ 候选复核(核心页面)。每条候选都摊开四路信号各自的贡献。 分数必须可解释,黑盒分数没人会信。入出点按镜头边界步进,不按秒—— 保证切片不落在镜头中间。弃用必须填原因,那是机器将来学会判断的唯一燃料。
导出结果页
④ 导出结果。每条留用的切片出横版与竖版两版加封面, 竖版裁切跟随主演人脸的位置而不是死切中间。操作日志同步落盘。
标注基准页
⑤ 标注基准。剪辑师标出本集的 Top-5 名场面。 这是唯一能衡量「找得准不准」的尺子——没有它,调权重就是凭感觉。 三十分钟标完一集,之后每次改权重都能立刻算出命中率。

开发日志