多模态 · 高光判定
四路信号并行识别,在一个可解释的加权判定处收敛。机器批量出候选,人只做最后一道创意终审。
「这一别,就当我从未来过。」
四路信号各自的贡献分开呈现。剪辑师要看得懂为什么是 92 分,才会信任它——黑盒分数没人会用。权重外置在配置里,现场能当场调、秒级重算。
某一路信号没有输入时,结果里会标明这一路处于降级状态,而不是给 0 分。「没输入」和「判断为零」是两件事,混在一起的分数不能用来做决定。
入出点吸附到最近的镜头切换点,不按秒对齐。切在镜头中间的片段,观感上一眼就是机器剪的。
候选卡片为示意数据。
怎么工作
识别全程走低分辨率代理流,只在最终渲染时回到原始源。单这一项就让识别耗时降一个数量级。镜头边界同时成为全链路的时间轴基准。
三路识别并行产出信号,在一个可解释的加权规则处汇合。权重外置在配置文件里。
每条切片出横版与竖版两版,竖版裁切跟随主演人脸的位置而不是死切中间。配套文案必须引用片段里的真实台词,不改写。
为什么值得做
剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠。
剪的部分早就有成熟软件。找的部分至今没有。
为什么至今没有
市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。
剧集的爆点在画面里:打斗、反转、告白、名场面。把开源逻辑照搬过来,结果是可预期的——找到一堆话密的片段,漏掉所有名场面。
所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品,直接用就好。唯独「这一段算不算高光」这个判断,没有任何开源项目替你回答。这也是我们唯一自研的部分。
产品
设计上只服务一件事:让「这一段算不算高光」这个判断变快。人不再从零开始剪,而是对机器的候选做取舍。
进展
八个流水线阶段全部实现,四路信号接通,工作台能完整走完一集。但日志里更值得看的是另一半:那些单元测试全绿、跑起真实素材才暴露的问题——降级状态自报正常、语音模型把提示词当台词吐回来、竖版裁切让演员贴在画面边缘。