一句创意进来,出来的是主题、人物关系和整体走向。它是一段可读可改的文本,不是一个不能拆的结果。后面十道工序都从这里长出来,所以这一步值得你多看两眼。
怎么工作
四条产线,十一道工序
第一天摆在面前的是两条路:做成编辑器,还是做成产线。我们选了产线。后面所有事情都是这个决定的推论 —— 工序化天然能单步重跑,天然留得下记录。这一页把十一道工序摊开讲。
一整条产线
从一句创意到一支能发出去的片子。制作五道、加工五道、装配一道,中间还有一格是你亲手排的时间线。加工那五道的先后不是排版排出来的,是被物理约束定死的:换个顺序,音画就对不上。
四条产线
每一条负责一件事
把一句创意变成可以拍的东西
顺序是有讲究的,不是随便排的
只有四件事:顺序、时长、转场、字幕
逐道说明
十一道工序,一道一道讲
下面这些不是功能列表,是产线真实的执行顺序,以及每一道为什么排在那儿。有两处看起来是反的:配音排在出画面之前,对口型排在镜头出片之前。原因写在对应那一道下面。
制作
把一句创意变成可以拍的东西
按形态切集:短剧默认三集,其余形态都是单片。每集结尾留一个钩子。这件事写在形态定义里,你不用在提示里交代。
每集展开成场次:场景标题、出场人物、台词。这些都是可以直接改的文本,不是只能整段重生成的黑箱。改完只重跑下游那几步。
把「必须保持一致的东西」挑出来:人物、场景、道具。这一步只出文字设定,参考图放在下一条产线上。拆开是有原因的:先把人设定下来,再花钱画。
每个镜头写清楚画面描述、时长、说话人和台词。时长会自己落在形态规定的区间里:短剧 2.5–8 秒,MV 1.5–4 秒,广告片 1–3 秒。这个区间你不需要知道,更不需要填。
加工
顺序是有讲究的,不是随便排的
先把人物和场景的参考图出出来,后面的镜头才有脸可依。一个镜头里出现的角色会全部带上参考图,不是只带说话的那一个:只带一张脸,另一个人就会每镜长得不一样。没有配图像能力时这一步整体跳过,镜头改用纯文生视频。一致性会差一些,但产线不停。
配音排在出画面之前,因为它会按实际语速回头改镜头时长。反过来做一次就知道了:画面早切走了,人还在说话。
有台词的镜头直接出对口型画面,成功的会覆盖原来那一版。所以它排在镜头出片之前:后者只补剩下还没画面的,不做重复的活。这道工序串行跑,因为接这活的那家原厂同时只收一个任务,并发提交只会互相排队。
只补还没有画面的镜头,已经有的一律不动。重复生成一次就是重复付一次钱。外部生成模型是提交后轮询的长任务,所以这一步并发跑:一批镜头同时在路上,你等的是最慢的那一个,不是所有镜头加起来。
按当前时间线导出一份 .srt 侧车字幕,供二次分发和平台上传。成片里的字幕则是烧录进画面的。两份都要,因为发布平台要的是可编辑的字幕文件,而观众看到的必须是画面里的字。
剪辑
只有四件事:顺序、时长、转场、字幕
这一格没有工序号,因为它不是产线跑出来的,是你亲手排的。挪顺序、掐时长、换转场、改字幕,只有这四件事。想要图层、关键帧、调色曲线?这不是那种工具。改乱了可以按分镜整条重建,有退路。
分享
拼成一支能发出去的片子
拼接、叠化、烧字幕、出成片和分享链接。转场失败退回硬切,缺画面的镜头会被跳过而不是让整支片子失败:你先拿到一支能看的片,再单独补那几镜。成片默认 private,分享要你显式开启。
物料出图
先把人定下来,后面的镜头才有脸可依
第 06 道工序的产物长这样:角色和场景的参考图先出来,后面每一个有这个人出场的镜头,都带着它去出片。一致性是这么锚出来的,不是靠在提示词里把同一张脸反复形容一遍。


- 一个镜头里出现几个角色就带几张参考图,不是只带说话的那一个。只带一张脸,另一个人会每镜长得不一样。
- 没配图像能力的时候这一道整体跳过,镜头改用纯文生视频。一致性会差一些,但产线不停 —— 图像是唯一一类没有内置兜底的能力,一张人物设定图糊不出来。
- 两张都是 AI 生成的。
三条产品约束
不用懂模型、随时能改、一直看得见
你不需要懂模型
什么是提示词工程、seed 是干嘛的、图生视频和文生视频差在哪、哪家擅长哪种镜头 —— 这些你都不该被要求知道。你输入一句话,产线负责把它翻译成十一道工序上的几十次模型调用。界面上不会有一个「模型」下拉框等着你填。
每一步都能停下来改
十一道工序,每一道的产物都是可读、可编辑、可单独重跑的结构化数据。新手一路确认到底,老手在任意一道停下来改完再往下走。同一条路,不是两套界面。
它在干什么、花了多少,你随时看得见
工序控制台显示每一道的状态、耗时、用的是哪家模型、失败原因。每一次外部调用都会落一条用量记录,失败的那些也记。漏掉失败的,成功率就变成一个只统计成功的数字,那它就不叫成功率了。
产品界面
工作台长这样
这些截图取自一次真跑通的全流程:项目、剧本、镜头、时间线都是产线自己生成的。那次跑的是草稿档,所以截图里的画面是内置预览的概念板。定稿档跑出来的成片是另外一次运行,我们把那一支原样放在站上 —— 不拿别处的片子来充数,也不拿概念板冒充成品。





剪辑台
只做四件事:顺序、时长、转场、字幕
我们不做通用视频编辑器,而且不打算做。剪辑台的存在只是为了让你在装配成片之前调一调那条时间线:挪个顺序、掐个时长、换个转场、改个字幕。想要图层、关键帧、调色曲线的话,这不是那种工具。
- 转场用叠化,失败就退回硬切。一个转场不该卡住整支片子。
- 装配时缺画面的镜头会被跳过,而不是整支片子失败。你先拿到一支能看的片,再单独补那几镜。
- 时间线可以按分镜整条重建。改乱了有退路。
模型路由
按镜头派活,一家挂了换下一家
路由是按镜头的,不是按项目的。同一集里的镜头要求差得很远:有的带参考图,有的只有两秒,有的要衔接尾帧。每次出片都先筛出能干这活的原厂,再按性价比排。一家失败换下一家,所有候选都失败才退回内置预览,而且兜底那几次不计费。
能力怎么筛、三种排序、什么错该重试什么错该立刻换家草稿与定稿
两档出片,档位是每次运行选的
同一个项目会草稿很多次、定稿一次。所以档位不是项目级配置,是你每次点运行时选的。
草稿
结构是真的,画面是概念板
走内置预览。分镜、节奏、配音、字幕、时间线全是真的,只有画面是概念板。几十秒出片,不消耗额度,不限量。
定稿
走真实生成模型,按用量计费
画面交给外部原厂模型产出,按秒和张计费。运行前会先告诉你这一步大概花多少。
省单价是 2–3 倍的事,省重试是 3–5 倍的事。前者要谈判、要接新供应商,还随时可能被厂商改一次价格改回去;后者只需要不让你为改了五遍的那五遍付钱。这是我们能拿到的最大一笔成本节省,而且它不受任何人的政策影响。
