多模态 · 高光判定
四路信号并行识别,在一个可解释的加权判定处收敛。机器批量出候选,人只做最后一道创意终审。
「这一别,就当我从未来过。」
四路信号各自的贡献分开呈现。剪辑师要看得懂为什么是 92 分,才会信任它——黑盒分数没人会用。权重外置在配置里,现场能当场调、秒级重算。
某一路信号没有输入时,结果里会标明这一路处于降级状态,而不是给 0 分。「没输入」和「判断为零」是两件事,混在一起的分数不能用来做决定。
入出点吸附到最近的镜头切换点,不按秒对齐。切在镜头中间的片段,观感上一眼就是机器剪的。
候选卡片为示意数据。
怎么工作
识别全程走低分辨率代理流,只在最终渲染时回到原始源。单这一项就让识别耗时降一个数量级。镜头边界同时成为全链路的时间轴基准。
三路识别并行产出信号,在一个可解释的加权规则处汇合。权重外置在配置文件里。
每条切片出横版与竖版两版,竖版裁切跟随主演人脸的位置而不是死切中间。配套文案必须引用片段里的真实台词,不改写。
为什么值得做
剧集切片今天是一条人工的线性流水线:编辑通看四十多分钟正片挑名场面,再粗剪、包装、配文。一集耗掉大半天,产出却高度依赖个人手感——同一集交给两个人,选出来的片段可能几乎不重叠。
剪的部分早就有成熟软件。找的部分至今没有。
为什么至今没有
市面上的自动切片项目几乎清一色是同一条逻辑:语音转文本,再让大模型从文本里找金句。这条逻辑服务的是播客、访谈、口播课程——信息密度确实集中在语音里的内容。
剧集的爆点在画面里:打斗、反转、告白、名场面。把开源逻辑照搬过来,结果是可预期的——找到一堆话密的片段,漏掉所有名场面。
所以我们的判断是:开源能给的是转码、字幕、镜头分割、人脸裁切这些工程件,它们是商品,直接用就好。唯独「这一段算不算高光」这个判断,没有任何开源项目替你回答。这也是我们唯一自研的部分。
产品
设计上只服务一件事:让「这一段算不算高光」这个判断变快。人不再从零开始剪,而是对机器的候选做取舍。
进展
四路信号全部接通,切片带上引用真实台词的配套文案。语音识别改走本地模型,不依赖外部接口也能跑通全链路。跑真实素材时抓到四个单元测试看不见的问题,其中一个是降级状态自报为「正常」——已修。
完成技术方案与三个子项目拆分。确定本机加外部接口的最小验证路径:除画面理解外全部可在 CPU 上跑,实测转码环节约四核分钟每集,不构成瓶颈。
完成开源清单与许可证梳理。一个候选项目因 AGPL 且触发条件含「通过网络提供服务」被排除;人脸识别的预训练权重标注非商用,已列入产品化前必须解决的清单。