跳到正文

怎么工作

四条产线,十一道工序

第一天摆在面前的是两条路:做成编辑器,还是做成产线。我们选了产线。后面所有事情都是这个决定的推论 —— 工序化天然能单步重跑,天然留得下记录。这一页把十一道工序摊开讲。

一整条产线

从一句创意到一支能发出去的片子。制作五道、加工五道、装配一道,中间还有一格是你亲手排的时间线。加工那五道的先后不是排版排出来的,是被物理约束定死的:换个顺序,音画就对不上。

四条产线与十一道工序的结构图制作产线 0101大纲02分集03剧本04物料05分镜加工产线 0206物料出图07配音08对口型09镜头出片10字幕剪辑产线 03时间线分享产线 0411装配成片
虚线那格是你亲手排的时间线,其余十一格是产线跑的工序。加工段的顺序不能调:配音必须先于出画面,因为它会按实际语速回头改镜头时长。

四条产线

每一条负责一件事

制作5

把一句创意变成可以拍的东西

01大纲主题、人物、整体走向
02分集按形态切集,每集留一个钩子
03剧本每集的场景与台词
04物料要保持一致的角色与场景
05分镜画面描述、时长、台词
加工5

顺序是有讲究的,不是随便排的

06物料出图先有参考图,后面才有脸可依
07配音按实际语速回头调整镜头时长
08对口型有台词的镜头直接出对口型画面
09镜头出片只补还没有画面的,不重复花钱
10字幕烧进成片,另出一份 .srt
剪辑你来排

只有四件事:顺序、时长、转场、字幕

时间线这一段是你亲手排的
分享1

拼成一支能发出去的片子

11装配成片拼接、转场、成片与分享链接

逐道说明

十一道工序,一道一道讲

下面这些不是功能列表,是产线真实的执行顺序,以及每一道为什么排在那儿。有两处看起来是反的:配音排在出画面之前,对口型排在镜头出片之前。原因写在对应那一道下面。

制作

把一句创意变成可以拍的东西

01
大纲
主题、人物、整体走向

一句创意进来,出来的是主题、人物关系和整体走向。它是一段可读可改的文本,不是一个不能拆的结果。后面十道工序都从这里长出来,所以这一步值得你多看两眼。

02
分集
按形态切集,每集留一个钩子

按形态切集:短剧默认三集,其余形态都是单片。每集结尾留一个钩子。这件事写在形态定义里,你不用在提示里交代。

03
剧本
每集的场景与台词

每集展开成场次:场景标题、出场人物、台词。这些都是可以直接改的文本,不是只能整段重生成的黑箱。改完只重跑下游那几步。

04
物料
要保持一致的角色与场景

把「必须保持一致的东西」挑出来:人物、场景、道具。这一步只出文字设定,参考图放在下一条产线上。拆开是有原因的:先把人设定下来,再花钱画。

05
分镜
画面描述、时长、台词

每个镜头写清楚画面描述、时长、说话人和台词。时长会自己落在形态规定的区间里:短剧 2.5–8 秒,MV 1.5–4 秒,广告片 1–3 秒。这个区间你不需要知道,更不需要填。

加工

顺序是有讲究的,不是随便排的

06
物料出图
先有参考图,后面才有脸可依

先把人物和场景的参考图出出来,后面的镜头才有脸可依。一个镜头里出现的角色会全部带上参考图,不是只带说话的那一个:只带一张脸,另一个人就会每镜长得不一样。没有配图像能力时这一步整体跳过,镜头改用纯文生视频。一致性会差一些,但产线不停。

07
配音
按实际语速回头调整镜头时长

配音排在出画面之前,因为它会按实际语速回头改镜头时长。反过来做一次就知道了:画面早切走了,人还在说话。

08
对口型
有台词的镜头直接出对口型画面

有台词的镜头直接出对口型画面,成功的会覆盖原来那一版。所以它排在镜头出片之前:后者只补剩下还没画面的,不做重复的活。这道工序串行跑,因为接这活的那家原厂同时只收一个任务,并发提交只会互相排队。

09
镜头出片
只补还没有画面的,不重复花钱

只补还没有画面的镜头,已经有的一律不动。重复生成一次就是重复付一次钱。外部生成模型是提交后轮询的长任务,所以这一步并发跑:一批镜头同时在路上,你等的是最慢的那一个,不是所有镜头加起来。

10
字幕
烧进成片,另出一份 .srt

按当前时间线导出一份 .srt 侧车字幕,供二次分发和平台上传。成片里的字幕则是烧录进画面的。两份都要,因为发布平台要的是可编辑的字幕文件,而观众看到的必须是画面里的字。

剪辑

只有四件事:顺序、时长、转场、字幕

时间线
这一段是你亲手排的

这一格没有工序号,因为它不是产线跑出来的,是你亲手排的。挪顺序、掐时长、换转场、改字幕,只有这四件事。想要图层、关键帧、调色曲线?这不是那种工具。改乱了可以按分镜整条重建,有退路。

分享

拼成一支能发出去的片子

11
装配成片
拼接、转场、成片与分享链接

拼接、叠化、烧字幕、出成片和分享链接。转场失败退回硬切,缺画面的镜头会被跳过而不是让整支片子失败:你先拿到一支能看的片,再单独补那几镜。成片默认 private,分享要你显式开启。

物料出图

先把人定下来,后面的镜头才有脸可依

第 06 道工序的产物长这样:角色和场景的参考图先出来,后面每一个有这个人出场的镜头,都带着它去出片。一致性是这么锚出来的,不是靠在提示词里把同一张脸反复形容一遍。

xAI · Grok Imagine
角色参考图:便利店店员,深色衬衫配灰围裙,正面全身,灰底棚拍
便利店店员的角色参考图。正面、全身、干净背景 —— 它的用处是给后面的镜头一个锚,不是拿来当画面用。
阿里云 · 通义万相
角色参考图:便利店店员,白衬衫配领带、胸前挂工牌,站在冷藏柜前
同一道工序,另一家出的另一张。两家的画风差得不是一点点,这正是为什么这一步要先跑完:参考图一定,整集的脸就定在这一张上了。
  • 一个镜头里出现几个角色就带几张参考图,不是只带说话的那一个。只带一张脸,另一个人会每镜长得不一样。
  • 没配图像能力的时候这一道整体跳过,镜头改用纯文生视频。一致性会差一些,但产线不停 —— 图像是唯一一类没有内置兜底的能力,一张人物设定图糊不出来。
  • 两张都是 AI 生成的。

三条产品约束

不用懂模型、随时能改、一直看得见

01

你不需要懂模型

什么是提示词工程、seed 是干嘛的、图生视频和文生视频差在哪、哪家擅长哪种镜头 —— 这些你都不该被要求知道。你输入一句话,产线负责把它翻译成十一道工序上的几十次模型调用。界面上不会有一个「模型」下拉框等着你填。

02

每一步都能停下来改

十一道工序,每一道的产物都是可读、可编辑、可单独重跑的结构化数据。新手一路确认到底,老手在任意一道停下来改完再往下走。同一条路,不是两套界面。

03

它在干什么、花了多少,你随时看得见

工序控制台显示每一道的状态、耗时、用的是哪家模型、失败原因。每一次外部调用都会落一条用量记录,失败的那些也记。漏掉失败的,成功率就变成一个只统计成功的数字,那它就不叫成功率了。

产品界面

工作台长这样

这些截图取自一次真跑通的全流程:项目、剧本、镜头、时间线都是产线自己生成的。那次跑的是草稿档,所以截图里的画面是内置预览的概念板。定稿档跑出来的成片是另外一次运行,我们把那一支原样放在站上 —— 不拿别处的片子来充数,也不拿概念板冒充成品。

工序控制台。十一道工序逐条列出状态和完成时间,每一道都能单独展开看日志、单独重跑。
工序控制台。十一道工序逐条列出状态和完成时间,每一道都能单独展开看日志、单独重跑。
加工台。这一集拆成了十一个镜头,每一格标着景别、时长和画面描述。缺画面的可以只补缺的那几个。
加工台。这一集拆成了十一个镜头,每一格标着景别、时长和画面描述。缺画面的可以只补缺的那几个。
剪辑台。十二个片段、成片时长 48 秒,点中片段在右侧改参数。改乱了,按分镜整条重建。
剪辑台。十二个片段、成片时长 48 秒,点中片段在右侧改参数。改乱了,按分镜整条重建。
制作台。剧本按场次展开,场景标题和台词都是可以直接改的文本,不是只能重生成的黑箱。
制作台。剧本按场次展开,场景标题和台词都是可以直接改的文本,不是只能重生成的黑箱。
顶栏一直挂着这个项目的消耗:多少秒画面、多少字配音、多少次模型调用,以及还剩多少额度。下面那排是十一道工序的实时状态。
顶栏一直挂着这个项目的消耗:多少秒画面、多少字配音、多少次模型调用,以及还剩多少额度。下面那排是十一道工序的实时状态。

剪辑台

只做四件事:顺序、时长、转场、字幕

我们不做通用视频编辑器,而且不打算做。剪辑台的存在只是为了让你在装配成片之前调一调那条时间线:挪个顺序、掐个时长、换个转场、改个字幕。想要图层、关键帧、调色曲线的话,这不是那种工具。

时间线装配示意图0s6s12s18s24s30s36s42s48s镜头片段0102030405叠化字幕轨音乐轨有人说话时让路
叠化是重叠不是相加:n 个镜头有 n-1 个转场,每个吃掉一段时长。做 MV 时这是硬指标,音乐没放完画面就黑了,片子就废了。
  • 转场用叠化,失败就退回硬切。一个转场不该卡住整支片子。
  • 装配时缺画面的镜头会被跳过,而不是整支片子失败。你先拿到一支能看的片,再单独补那几镜。
  • 时间线可以按分镜整条重建。改乱了有退路。

模型路由

按镜头派活,一家挂了换下一家

路由是按镜头的,不是按项目的。同一集里的镜头要求差得很远:有的带参考图,有的只有两秒,有的要衔接尾帧。每次出片都先筛出能干这活的原厂,再按性价比排。一家失败换下一家,所有候选都失败才退回内置预览,而且兜底那几次不计费。

能力怎么筛、三种排序、什么错该重试什么错该立刻换家

草稿与定稿

两档出片,档位是每次运行选的

同一个项目会草稿很多次、定稿一次。所以档位不是项目级配置,是你每次点运行时选的。

草稿

结构是真的,画面是概念板

走内置预览。分镜、节奏、配音、字幕、时间线全是真的,只有画面是概念板。几十秒出片,不消耗额度,不限量。

定稿

走真实生成模型,按用量计费

画面交给外部原厂模型产出,按秒和张计费。运行前会先告诉你这一步大概花多少。

省单价是 2–3 倍的事,省重试是 3–5 倍的事。前者要谈判、要接新供应商,还随时可能被厂商改一次价格改回去;后者只需要不让你为改了五遍的那五遍付钱。这是我们能拿到的最大一笔成本节省,而且它不受任何人的政策影响。

先跑一集看看

注册就能用,草稿不限量。一整条产线走完大概几分钟,结束时你手里是一支能发出去的片子。