跳到正文

模型评分

模型好不好,产线数据说了算

五家原厂各有各的榜单,分数都很好看。我们一条都不采信。唯一算数的是这家在我们的产线上,给用户交出了什么。先说清楚一件事:公开环境目前一家凭据都没配,所以这块记分牌现在是空的。下面讲的是它怎么算,以及为什么等真有数的那天,那些数值得信。

为什么不采信厂商榜单

他们考的不是我们要做的这道题

厂商报的是自家榜单:样本、题材、评判口径都是他们自己定的。那套题跟短剧里的镜头对不上 —— 带参考图的、只有两秒的、招牌上还得有中文字的,这些他们不考。更要紧的是,榜单根本不回答产线真正的问题:一个便宜、却三次里挂一次的模型,算上重试、用户等待和白烧的额度,实际上比贵的更贵。没有任何一张厂商的表会告诉你这件事。

  • 评分的原始数据只有一个来源:真实出片。哪一次成了、等了多久、这一镜后来被重做了几次、有没有人点踩。
  • 每一次调用都记一条用量,包括失败的那些(用量记零,所以不计费)。不这么做的话,成功率的分母里只剩成功的,谁都是 100%。
  • 只看最近 30 天。窗口内一视同仁,窗口外直接不算。一家上个月不行、这个月修好了,分数一个月内就跟得上。

四个信号

权重是这么分的

可靠性最重,因为一个又快又好、但三次里挂一次的模型,在产线上是净负担:你要等、要重试、还烧了额度。速度最轻,因为慢只是难受,挂了才是交不出片。

可靠性45%

数据来自

每一次调用的成败,以及有没有走兜底

成功率是客观事实,没法粉饰。兜底算半个失败:它交出了东西,但不是你买的那个。

返工率25%

数据来自

同一个镜头被出片几次

你重做一个镜头,就是在说这个不行。这条信号不用你多做任何事,那次重做本来就要发生。

满意度20%

数据来自

你在镜头上点的赞和踩

显式反馈,量少但方向明确。点踩的原因是固定选项而不是自由文本:「人物不一致」和「动作不自然」指向完全不同的模型能力,聚合起来才有意义。

速度10%

数据来自

每秒成品画面要等多久

权重最低,但它确实影响体验,所以留在表里。等待时间按每秒成品画面折算,免得长镜头天生吃亏。

最值钱的那一个

返工率:不用你多做什么,也不会骗人

四个信号里,返工率是我们最看重的。原因很简单:它是行为,不是评价。请人给一个镜头打分,大部分人会跳过;但没有人会留着一个不满意的镜头不管。你按下「重做这一镜」的那一刻,已经给出了最准确的判断,而且没多花一秒钟。

  • 只有真的产出过的镜头才算数。失败之后的重试不进返工率,那是系统的问题,不是你在说「这个不行」。
  • 点踩指向哪一家,是从产物自己的记录里取的,不由提交方填写。否则谁都能给竞争对手刷差评。
  • 分数按团队可分。全平台口径样本多,用作路由的默认值;你自己团队的口径反映你自己的题材 —— 拍悬疑和拍广告,对模型的要求本来就不一样。

五条规则

一个能被做歪的评分,不如没有

下面这五条不是实现细节,是这套评分能不能被信任的前提。每一条都对应一种把分数做得好看、但把选择做得更差的做法。

01

样本不足就不给分

少于 8 次调用只报原始数据,不出综合分,也不参与路由。三次调用的成功率是噪声,不是信号。宁可在界面上写「数据不足」,也不拿它去决定谁来出片。

02

缺数据的项要排除,不能按 0 计

「还没有人评价」不等于「评价很差」,「没记到耗时」也不等于「很慢」。缺的项排掉,把它的权重按比例分给还在的项。只剩可靠性和返工率时,45 比 25 这个比例原样保留,不会因为少了两项就变形。

03

新模型给中性分

没有产线数据的原厂按中性分 0.6 起步,不按 0。全按 0 处理的话,新接进来的永远排最后、永远拿不到样本、也就永远没有分。那评分系统就成了一个自我实现的预言。

04

兜底算半个失败

退回内置预览的那一次,不能记成成功。它确实交出了东西,但不是你买的那个。记成成功会让一家「从不报错、但总在兜底」的模型看起来完美无缺。

05

评分只影响排序,不影响可用性

分低的仍然可以被选中,尤其在别家都挂了的时候。我们的底线是交得出片,不是只用最好的那一家。一个会因为「候选都不够好」而放弃出片的系统,对你没有价值。

主动基准测试

新模型不用等被派活才有分

分数全部来自真实生产,好处是零偏差,坏处是新模型冷启动慢:它得先被派几次活才有分,而没有分就不容易被派活。所以我们会主动对每一家跑一遍标准用例,当天就拿到基线分。实验室数据和真实生产在报告里分开看 —— 标准用例毕竟不是你的真实题材。

六条视频用例

01
静态空镜

画面稳不稳、有没有明显瑕疵。这是基线,这条都做不好的不用往下看。

02
人物动作

动作连不连贯、有没有肢体扭曲。这是最容易露馅的一条。

03
运镜

有没有真的按要求运镜,还是只给了个静止画面加抖动。

04
画面文字

中文字形对不对。很多模型这块很差,而短剧里招牌、门牌到处都是。

05
人物一致性

和参考图里是不是同一个人。这条直接决定能不能做连续剧。

06
快节奏短镜

短镜头会不会被拉长、或者塞进多余的动作。广告和 MV 全靠这个。

加一条用例的标准只有一个:它能不能区分出模型之间的差距。「生成一段风景」人人都能做,跑它只是烧钱;「招牌上写着两个中文字」一眼就看得出谁行谁不行。跑一轮是真金白银 —— 用例数 × 家数 × 每条的秒数 —— 所以运行前先报预估,确认了才跑。

分数是给路由看的,片子是给你看的

这一整套只为一件事服务:同一个镜头,派给此刻最可能一次做对的那一家。你不需要知道它选了谁。但如果你想知道,控制台上写着。