FAQ
下面的答案都以「一句话直答」开头,读者不必读完整段才知道结论。有几条的答案不好看,但它们是真的——把这些先说出来,比等人问出来好。
最要紧的一问
还不知道——因为缺一把尺子。
系统能给每条候选打出分数,也能摊开四路信号各自的贡献。但「这五条是不是真的就是本集最好的五条」,目前没有任何客观依据可以回答。
要回答它,需要剪辑师先标出一集的 Top-5 名场面作为对照,之后每次调权重都能算出命中了几条。这是一次性的、大约半小时的投入,界面早就就绪。在那之前,任何关于准确率的说法都只是印象。
把这条放在最前面,是因为它比任何功能都重要:一套无法被衡量的判断系统,调参就是凭感觉。
关于效果
它会取代剪辑师吗?
不会。它取代的是「通看四十多分钟找名场面」这一段。
剪的部分早就有成熟软件,找的部分至今没有——这套系统做的是后者。机器把一集压缩成五条带判据的候选,人对这五条做取舍。机器不做审美判断,人不做重复劳动。
更实际的一点:最终发出去的每一条,都经过人点了「留用」。系统没有自动发布的路径。
它选错了怎么办?
弃用,填一句原因,然后可以当场调权重重跑。
弃用原因不是走流程——它是这套系统将来学会自己判断的唯一训练标签来源。「节奏太拖」「主演没露脸」「和前面那条重复」,每一条都是一次标注。
如果是系统性地选偏了(比如总在挑打斗、漏掉文戏),那不该逐条弃用,而该去调权重:四路信号各占多少写在配置文件里,改完重算只要零点几秒。
为什么判定用的是加权规则,不是一个模型?
因为规则能解释,也能现场调;模型两样都做不到。
黑盒分数没人会用——剪辑师看不懂为什么是 92 分,就不会信任它。加权规则可以把四路信号各自的贡献摊开摆在界面上。
更实际的是可调性:现场觉得「明星权重太高了」,改一个数字、重算零点几秒就能看到结果。换成模型,这个动作是重新训练。在还没有质量基线的阶段,可调比准确更重要——因为你至少能试。
四路信号里有一路挂了会怎样?
链路照常走完,并且会明说哪一路没跑成。
每一路识别都有对应的降级行为,自动触发。但更重要的是结果的诚实性:某一路没有输入时,界面标明它处于降级状态,而不是给它记 0 分。
「没输入」和「判断为零」是两件事。混在一起的分数不能用来做决定——使用者会以为「这段确实没有转折」,而真相可能是「那一路根本没跑成」。这个区分曾经被一个 bug 破坏过,日志里有记录。
关于性能与成本
需要 GPU 吗?
不需要。目前全部实测都在一台十核 CPU 的笔记本上完成。
关键的成本手段是代理流:识别阶段全程跑低分辨率,只在最终渲染时回到原始源。单这一项就让识别耗时降一个数量级。
语音识别也在本机跑,不依赖任何外部接口。画面理解走接口,但它是四路里唯一一路——接口不可用时链路照样走完,只是那一路降级。
一集要跑多久?
验收上限是三十分钟。已实测的部分远低于此,完整数字待真实剧集素材。
在一段 48.9 分钟的素材上,转码、镜头分割、帧间差分三步合计 134 秒,检出 613 个镜头。
| 阶段 | 48.9 分钟素材 |
|---|---|
| 转码代理流 | 76 s |
| 镜头分割 | 30 s |
| 帧间差分 | 28 s |
| 高光打分 | <1 s |
识别三路都只跑候选范围而不是全片,这是能压进三十分钟的关键。台词转写全片要十八分钟,只转候选窗口约三分钟。
需要说清楚的是:上面的测试素材不是剧集,完整链路的端到端数字要等真实素材跑过才算数。
调一次权重要等多久?
零点三秒。
每个阶段的产物都落盘,重算时上游直接读缓存——因为调权重根本不改变识别结果,只改变怎么给它们加权。
这个差别不是性能指标,而是它决定了「调权重」是一个值得反复试的动作,还是一个想想就算了的动作。而调权重只有能反复做才有价值。
关于数据与合规
视频会被传到外面吗?
原始素材、代理流、抽帧全程留在本机,不出这条线。
这是整套架构的第一约束,不是事后加的策略。工作台连上传功能都没有——素材放在服务器目录里由界面选取,因为一集正片两三个 G,经浏览器传既没有意义,也让介质多走了一段不必要的路。
目前只有画面理解那一路会把抽出的帧送到外部接口。如果这一条也不能接受,把那一路关掉即可,链路会降级但照样跑完,其余三路信号不受影响。语音识别已经改成本机跑,不再有文本外发。
有没有许可证上的坑?
有一个,已经知道,产品化前必须解决。
人脸识别用的预训练权重标注为非商用。内部验证阶段不受影响,但对外交付前须采购授权、换模型或自训。这一条从选型时就列在必解清单上。
另外有一个候选开源项目因为许可证被排除——它的传染条件包含「通过网络提供服务」,正好是本产品的形态。
关于适用范围
综艺、纪录片、电影能用吗?
当前版本只做剧集,其余明确不做。
不是技术上不能,是判断标准不一样。剧集的高光是打斗、反转、告白、名场面;综艺的高光是笑点密度和名场面梗;纪录片几乎没有「爆点」这个概念。四路信号的权重预设是按剧集调的,直接套到别的类型上,结果不会好。
好在权重是外置的——换类型意味着重新配一套权重和一套基准标注,而不是重写代码。
能换成别的模型或服务商吗?
能,改配置文件即可,业务代码不动。
画面理解与文案生成走的是通用接口协议,几家主流服务商和本地部署都兼容,切换只是换一个地址和模型名。文本与视觉可以分别用不同的服务商。
语音识别是例外:它现在跑在本机,不走接口。
4K 素材呢?
当前版本按 720P 验证,4K 不在这一轮范围内。
代理流机制天然对高分辨率友好——识别阶段本来就要降到低分辨率,源片是 720P 还是 4K,对识别耗时影响不大。真正变贵的是最终渲染那一步。
它会自己变得更准吗?
还不会。数据在攒,但回路还没建。
每一次留用、弃用、入出点微调都在被记录,弃用的原因也一并存下——这是为了将来能从人的判断里归纳出规则。但目前还没有任何东西把这些记录变成判定规则的改进,它们只是躺在那里。
这是下一阶段的事。先攒数据是对的,但「在攒数据」和「在变聪明」是两回事。