数据来自
每一次调用的成败,以及有没有走兜底
成功率是客观事实,没法粉饰。兜底算半个失败:它交出了东西,但不是你买的那个。
模型评分
五家原厂各有各的榜单,分数都很好看。我们一条都不采信。唯一算数的是这家在我们的产线上,给用户交出了什么。先说清楚一件事:公开环境目前一家凭据都没配,所以这块记分牌现在是空的。下面讲的是它怎么算,以及为什么等真有数的那天,那些数值得信。
为什么不采信厂商榜单
厂商报的是自家榜单:样本、题材、评判口径都是他们自己定的。那套题跟短剧里的镜头对不上 —— 带参考图的、只有两秒的、招牌上还得有中文字的,这些他们不考。更要紧的是,榜单根本不回答产线真正的问题:一个便宜、却三次里挂一次的模型,算上重试、用户等待和白烧的额度,实际上比贵的更贵。没有任何一张厂商的表会告诉你这件事。
四个信号
可靠性最重,因为一个又快又好、但三次里挂一次的模型,在产线上是净负担:你要等、要重试、还烧了额度。速度最轻,因为慢只是难受,挂了才是交不出片。
数据来自
每一次调用的成败,以及有没有走兜底
成功率是客观事实,没法粉饰。兜底算半个失败:它交出了东西,但不是你买的那个。
数据来自
同一个镜头被出片几次
你重做一个镜头,就是在说这个不行。这条信号不用你多做任何事,那次重做本来就要发生。
数据来自
你在镜头上点的赞和踩
显式反馈,量少但方向明确。点踩的原因是固定选项而不是自由文本:「人物不一致」和「动作不自然」指向完全不同的模型能力,聚合起来才有意义。
数据来自
每秒成品画面要等多久
权重最低,但它确实影响体验,所以留在表里。等待时间按每秒成品画面折算,免得长镜头天生吃亏。
最值钱的那一个
四个信号里,返工率是我们最看重的。原因很简单:它是行为,不是评价。请人给一个镜头打分,大部分人会跳过;但没有人会留着一个不满意的镜头不管。你按下「重做这一镜」的那一刻,已经给出了最准确的判断,而且没多花一秒钟。
五条规则
下面这五条不是实现细节,是这套评分能不能被信任的前提。每一条都对应一种把分数做得好看、但把选择做得更差的做法。
少于 8 次调用只报原始数据,不出综合分,也不参与路由。三次调用的成功率是噪声,不是信号。宁可在界面上写「数据不足」,也不拿它去决定谁来出片。
「还没有人评价」不等于「评价很差」,「没记到耗时」也不等于「很慢」。缺的项排掉,把它的权重按比例分给还在的项。只剩可靠性和返工率时,45 比 25 这个比例原样保留,不会因为少了两项就变形。
没有产线数据的原厂按中性分 0.6 起步,不按 0。全按 0 处理的话,新接进来的永远排最后、永远拿不到样本、也就永远没有分。那评分系统就成了一个自我实现的预言。
退回内置预览的那一次,不能记成成功。它确实交出了东西,但不是你买的那个。记成成功会让一家「从不报错、但总在兜底」的模型看起来完美无缺。
分低的仍然可以被选中,尤其在别家都挂了的时候。我们的底线是交得出片,不是只用最好的那一家。一个会因为「候选都不够好」而放弃出片的系统,对你没有价值。
主动基准测试
分数全部来自真实生产,好处是零偏差,坏处是新模型冷启动慢:它得先被派几次活才有分,而没有分就不容易被派活。所以我们会主动对每一家跑一遍标准用例,当天就拿到基线分。实验室数据和真实生产在报告里分开看 —— 标准用例毕竟不是你的真实题材。
画面稳不稳、有没有明显瑕疵。这是基线,这条都做不好的不用往下看。
动作连不连贯、有没有肢体扭曲。这是最容易露馅的一条。
有没有真的按要求运镜,还是只给了个静止画面加抖动。
中文字形对不对。很多模型这块很差,而短剧里招牌、门牌到处都是。
和参考图里是不是同一个人。这条直接决定能不能做连续剧。
短镜头会不会被拉长、或者塞进多余的动作。广告和 MV 全靠这个。
加一条用例的标准只有一个:它能不能区分出模型之间的差距。「生成一段风景」人人都能做,跑它只是烧钱;「招牌上写着两个中文字」一眼就看得出谁行谁不行。跑一轮是真金白银 —— 用例数 × 家数 × 每条的秒数 —— 所以运行前先报预估,确认了才跑。