把一集正片自动切成可发布的短视频:机器批量生产候选,人只做最后一道创意终审。
剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。 一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠。
瓶颈不在剪辑工具,在"找"。剪的部分早就有成熟软件,找的部分至今没有。
市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。 这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。
剧集不是这样。剧集的爆点在画面里:打斗、反转、告白、名场面。 把开源逻辑照搬到剧集上,结果是可预期的——找到一堆话密的片段,漏掉所有名场面。
所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品, 直接用就好。唯独"这一段算不算高光"这个判断,没有任何开源项目替你回答。 这也是我们唯一自研的部分。
三路识别并行跑,在一个可解释的加权判定处收敛:
转码 · 镜头分割
│
├──→ 台词转写 情绪强度 · 金句
├──→ 画面理解 动作强度 · 场景标签
└──→ 人脸追踪 主演在场
│
▼
高光判定引擎 ★ 唯一自研
│
┌─────────┴─────────┐
▼ ▼
切片渲染 封面与文案
判定用的是可解释的加权规则,不是黑盒模型。四路信号各自的贡献分开呈现, 权重外置在配置文件里——现场能当场调、秒级重算,不必重跑上游识别。 这在演示和调优时的价值,远大于多几个百分点的准确率。
完成技术方案与三个子项目拆分。确定本机加外部模型接口的最小验证路径: 除画面理解外全部可在 CPU 上跑,实测转码环节约四核分钟每集,不构成瓶颈。
完成开源清单与许可证梳理。一个候选项目因 AGPL 且触发条件含"通过网络提供服务"被排除; 人脸识别的预训练权重标注非商用,已列入产品化前必须解决的清单。