剧集高光切片引擎

把一集正片自动切成可发布的短视频:机器批量生产候选,人只做最后一道创意终审。

问题

剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。 一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠。

瓶颈不在剪辑工具,在"找"。剪的部分早就有成熟软件,找的部分至今没有。

为什么开源方案解不了

市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。 这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。

剧集不是这样。剧集的爆点在画面里:打斗、反转、告白、名场面。 把开源逻辑照搬到剧集上,结果是可预期的——找到一堆话密的片段,漏掉所有名场面

所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品, 直接用就好。唯独"这一段算不算高光"这个判断,没有任何开源项目替你回答。 这也是我们唯一自研的部分。

架构

三路识别并行跑,在一个可解释的加权判定处收敛:

转码 · 镜头分割
      │
      ├──→ 台词转写      情绪强度 · 金句
      ├──→ 画面理解      动作强度 · 场景标签
      └──→ 人脸追踪      主演在场
                │
                ▼
        高光判定引擎  ★ 唯一自研
                │
      ┌─────────┴─────────┐
      ▼                   ▼
  切片渲染            封面与文案

判定用的是可解释的加权规则,不是黑盒模型。四路信号各自的贡献分开呈现, 权重外置在配置文件里——现场能当场调、秒级重算,不必重跑上游识别。 这在演示和调优时的价值,远大于多几个百分点的准确率。

开发日志