剧集高光切片引擎 Highlight Clipping Engine

多模态 · 高光判定

一集正片进去,可发布的短视频出来。

四路信号并行识别,在一个可解释的加权判定处收敛。机器批量出候选,人只做最后一道创意终审。

12:34 – 13:48 74 秒 92
对白情绪72
视觉动作96
主演在场98
场景转折88
「这一别,就当我从未来过。」
入出点吸附镜头边界 16:9 + 9:16 文案引用真实台词

分数是可解释的

四路信号各自的贡献分开呈现。剪辑师要看得懂为什么是 92 分,才会信任它——黑盒分数没人会用。权重外置在配置里,现场能当场调、秒级重算。

缺料会明说,不假装判断过

某一路信号没有输入时,结果里会标明这一路处于降级状态,而不是给 0 分。「没输入」和「判断为零」是两件事,混在一起的分数不能用来做决定。

切口落在镜头边界上

入出点吸附到最近的镜头切换点,不按秒对齐。切在镜头中间的片段,观感上一眼就是机器剪的。

候选卡片为示意数据。

48.9分钟单集素材端到端实测
613镜头自动分割,切片不落在镜头中间
4信号加权融合,权重可现场调
0.3改完权重重算,不必重跑识别

怎么工作

三路识别并行跑,在判定处收敛。

01 · 拆解

转码与镜头分割

识别全程走低分辨率代理流,只在最终渲染时回到原始源。单这一项就让识别耗时降一个数量级。镜头边界同时成为全链路的时间轴基准。

02 · 判定

四路信号加权收敛

三路识别并行产出信号,在一个可解释的加权规则处汇合。权重外置在配置文件里。

  • 台词转写 → 对白情绪
  • 画面理解 → 视觉动作
  • 人脸追踪 → 主演在场
  • 场景标签 → 转折强度
03 · 产出

渲染与配文

每条切片出横版与竖版两版,竖版裁切跟随主演人脸的位置而不是死切中间。配套文案必须引用片段里的真实台词,不改写。

看完整架构图 · 七个阶段与四路信号 →

为什么值得做

瓶颈不在剪,在找。

剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠

剪的部分早就有成熟软件。找的部分至今没有。

为什么至今没有

开源方案解不了这个问题。

市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。

剧集的爆点在画面里:打斗、反转、告白、名场面。把开源逻辑照搬过来,结果是可预期的——找到一堆话密的片段,漏掉所有名场面。

所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品,直接用就好。唯独「这一段算不算高光」这个判断,没有任何开源项目替你回答。这也是我们唯一自研的部分。

产品

整条链路的产物,落到一个本地工作台里。

设计上只服务一件事:让「这一段算不算高光」这个判断变快。人不再从零开始剪,而是对机器的候选做取舍。

候选复核页:左侧候选列表,右侧预览与四路信号分数拆解
候选复核。每条候选都摊开四路信号各自的贡献——分数必须可解释,黑盒分数没人会信。入出点按镜头边界步进,不按秒,保证切片不落在镜头中间。弃用必须填原因,那是机器将来学会判断的唯一燃料。
新建任务页:素材选择、剧集信息、输出提示选项、明星参考照
新建任务。从服务器已有素材里选片,不做上传——一集正片 2–3GB,经浏览器传没有意义,而且介质本就不该离开这台机器。输出提示选项会改变四路信号的权重侧重。
处理进度页:六个阶段的工具与产出
处理进度。六个阶段各自报告用了什么工具、产出了什么。任一环节失败会自动降级并继续,不中断整条链路。
标注基准页:播放器与已标注的名场面片段列表
标注基准。剪辑师标出本集的 Top-5 名场面。这是唯一能衡量「找得准不准」的尺子——没有它,调权重就是凭感觉。三十分钟标完一集,之后每次改权重都能立刻算出命中率。
导出结果页:留用统计与操作日志
导出结果。每条留用的切片出横版与竖版两版加封面。操作日志同步落盘。

怎么用 · 五步走完一集,人只占两步 →

进展

开发日志

八个流水线阶段全部实现,四路信号接通,工作台能完整走完一集。但日志里更值得看的是另一半:那些单元测试全绿、跑起真实素材才暴露的问题——降级状态自报正常、语音模型把提示词当台词吐回来、竖版裁切让演员贴在画面边缘。

读开发日志 · 时间线与四类失败模式 →