小说产线 · 小说转视频 AI

小说转视频:从章节原文到分镜关键帧的 9 步产线

把一章小说变成能看的视频,难点从来不是「生成一张好看的图」,而是几十个镜头之间的连续性:同一个主角在第三镜和第三十镜是不是同一张脸,情绪在切镜时有没有断,台词念完画面是不是还在。手工做的人通常一边翻原文一边写提示词,每个镜头重新描述一次人物,写到后面人物就开始走样,节奏也只能在剪辑台上才看得出来。

这条产线给的是一套固定顺序:先把原文拆成结构化剧本,再建角色和美术两份「圣经」,用便宜的线稿和白模把构图跑通,最后才花钱渲染关键帧和视频。每一环的产物都会作为下一环的输入原样传下去,剧本、角色、分镜这几个点必须你点头才往下走。适合想先做出一版样片或动态分镜的作者、编剧,以及做小说推文、漫剧的内容团队。

打开工作台,用「小说影视化」开工
参考片段:一支古装题材 AI 成片的画面,用来示意这条产线瞄准的镜头质感与构图纵深,并非本产线直接生成的样例。

这条产线做什么

小说文本→结构化剧本JSON→资产先行→锁构图分镜→成组关键帧的影视化流水线。共 9 个环节:剧本 → 角色卡 → 美术卡 → 分镜 → 预演 → 关键帧 → 视频 → 配音 → 成片。

  1. 1拆解剧本

    按「场」切分而不是按章节切:地点或时间一变就换场。每场标出起止拍、冲突点和从 -5 到 +5 的情绪值;台词按每秒 4.5 字折算成秒数写进表里,后面分镜、配音直接引用,不再各算各的。每场还会标出钩子位(悬念、反转、情绪爆点),作为后面重点精修的候选镜头。

    输入
    你贴进来的章节原文;没有原文时,助理会一次问齐题材、主角设定和篇幅。
    交付
    机器可读的结构化场次表(场次、节拍、台词及折算时长、钩子位、情绪曲线)加一页人能快速读完的故事大纲。
    人工确认点
    大纲和场次表你没确认之前,任何出图环节都不会开始。
    容易翻车的地方
    心理描写多、对白少的章节,折算出来的时长会偏短。可以在这一步就让助理把内心独白改成旁白,或者标出需要留白的反应镜头,别等到分镜才发现片子太赶。
  2. 2建角色圣经

    给每个角色写一份 8 维外观签名:脸型、发型、瞳色、体型、服装、配饰、肤色、气质,每一维对应一个固定短语。之后所有镜头原样复用这些短语,因为换一个同义词,模型就可能画出另一张脸。每个角色出正面特写、全身、侧面三视图,记录专属 seed 和参考图编号。主要角色以 2 到 5 个为宜,配角可以合并建档。

    输入
    上一步确认过的场次表里的人物清单和外观描写。
    交付
    角色圣经:每人一份 8 维签名、三视图和专属 seed。可以右键把三视图存为角色卡锁定,之后提示词里引用角色就自动带上参考图。
    人工确认点
    逐个角色确认三视图。换脸是成片阶段最大的返工来源,这里多看几分钟最划算。
    容易翻车的地方
    古装、制服这类题材里多个角色服装相近时最容易串脸。把区分度放在发型、配饰这些显眼的维度上,比在「气质」里堆形容词有效。
  3. 3定美术圣经

    把全片的视觉风格写成一段固定后缀:镜头语言、渲染质感、色板、光照方案,之后每一次生图都追加同一段,相当于给整部片挂一个风格锁。材质高光也写进规范(金属偏亮、皮肤偏哑),避免不同镜头里人物忽油忽干。每个主要场景出 1 到 2 张设定图,同一组 seed 只换场景内容,这些设定图同时编号,作为后续镜头的背景参考。

    输入
    角色圣经和剧本里的世界观、场景描写。
    交付
    美术圣经(世界观关键词库、色板、光照方案、材质规范)、每场景设定图、一组统一风格参考图。
    人工确认点
    设定图组要过风格统一性审计(色彩方差、质感一致性、风格关键词命中),低于 70 分回去改风格模板,不带着问题往下走。
    容易翻车的地方
    风格描述里同时塞两种互相冲突的参照,是全片漂移的常见起因。一部片先定一个主参照,其余作为局部点缀。
  4. 4锁定分镜

    先用黑白线稿铺完全部分镜,只验证构图和叙事节奏:线稿画错了重来,成本远低于重渲彩色关键帧。每镜写清景别(远、全、中、近、特)、机位角度、运镜(推、拉、摇、移、跟)和时长(台词折算秒数加反应拍)。对手戏按「听见→停顿→眼神→表情→说话」这条情绪时序拆出反应镜头,避免整场都是面无表情的对白。转场处预先标好 J-cut(声音先入)或 L-cut(声音延后),剪辑时照标记执行。

    输入
    剧本场次表、角色圣经和美术圣经。
    交付
    逐镜分镜表(景别、机位、运镜、时长、转场标记)、黑白线稿分镜板,以及一份 17 项的分镜质检报告。
    人工确认点
    线稿板和分镜表给你过目,节奏与构图确认后才进入关键帧渲染。
  5. 53D 白模预演

    在导演台上把分镜落成可回放的 3D 白模时间线。助理先读取导演台现有状态,再按分镜表提出几套构图、机位、走位方案,停下来等你选;你确认后才逐镜细化走位和运镜。

    输入
    已批准的分镜表。
    交付
    白模预演方案(逐镜构图、运镜、走位,时间线可回放)和你确认过的镜头方案记录。
    人工确认点
    预演方案选定之前,不会落下任何镜头动作。
    容易翻车的地方
    白模只解决空间关系:谁站在哪、镜头从哪个方向看。它不负责光影和质感,这一步不要纠结画面好不好看。
  6. 6渲染关键帧

    每个镜头出首帧和尾帧两张彩色图,留给下一步图生视频当起止帧;运镜意图写在两帧的差异里,比如推镜就是尾帧同构图放大。角色一致性靠三样东西同时锁住:8 维签名原文复用、角色专属 seed、三视图参考图,任何一项改动都要记下原因。钩子位对应的镜头多出 2 到 3 张候选择优,落选帧留档不删。

    输入
    分镜表、白模预演确认的机位,以及角色和美术的锁定资产。
    交付
    覆盖全部镜头的彩色关键帧(每镜首帧、尾帧各一)和失败镜头的重渲记录。
    人工确认点
    逐镜与角色三视图比对脸部、服装、配色,不一致的镜头打回重渲,全部通过才进视频合成。
    容易翻车的地方
    多人大场面最容易出错。重要戏份尽量用主角中近景,群像用背影或远景交代。
  7. 7合成镜头视频

    用首尾帧驱动图生视频:提示词只写两帧之间的动作和情绪变化,不再重复描述静态外观。表演镜头按情绪时序链编排,让人物先有反应再开口。下一镜的起始帧可以直接引用上一镜的尾帧,保证动作连续、场景不跳。单镜 3 到 8 秒为宜,更长的镜头拆成几段生成再拼接。

    输入
    上一步通过比对的首尾帧与镜头顺序。
    交付
    逐镜视频片段 MP4、镜头元数据(时长、分辨率、首尾帧缩略图)和失败重试记录。
    人工确认点
    每段视频抽首、中、尾 3 帧与关键帧比对,出现明显形变、闪帧或角色漂移就重新生成。
    容易翻车的地方
    运动幅度越大越容易崩。打斗、奔跑这类镜头宁可拆成多个短镜,也不要一口气生成长段。
  8. 8配音配乐

    按台词表逐镜生成配音,语速对齐前面折算好的时长,超时就微调语速或给镜头加半秒;背景音乐按剧本情绪曲线分段,转折点对齐钩子位;另出一张音效点位表(脚步、开门、风声),与转场标记对齐。对白镜头人声优先,音乐自动压低。

    输入
    镜头视频片段、台词表和情绪曲线。
    交付
    逐镜配音音轨、分段背景音乐和音效点位表。
    人工确认点
    随机抽 3 个对白镜头,核对人声时长与画面时长,偏差超过 0.5 秒回炉。
    容易翻车的地方
    这一环依赖的配音上游目前可能返回不可用。遇到时助理会直接说明,不会假装完成;台词表和时长锚点仍然可以拿去别的配音工具使用。
  9. 9组装成片

    按时序拼接全部镜头,执行分镜表里预埋的 J-cut、L-cut 转场,人声、音乐、音效分三轨混音,按台词时间码生成字幕,并附上封面帧和逐镜溯源表:每一镜对应哪张关键帧、哪个 seed、重渲过几次,方便你点名返工某一镜。

    输入
    镜头片段、配音音轨与转场标记。
    交付
    成片 MP4、SRT 字幕、封面帧和逐镜溯源表。
    人工确认点
    完整播放一遍核对口型、字幕、响度和钩子节奏,你验收通过后归档整条产线的资产。
    容易翻车的地方
    与配音环相同,组装成片的上游目前也可能不可用。此时镜头片段和剪辑清单照常交付,可以导入常用剪辑软件完成最后一步。

适合谁 / 不适合谁

手上有完整章节或短篇,想先做一版可看的动态分镜或样片,拿去给平台、合作导演或投资方看的作者与编剧。

做小说推文、漫剧类账号,同一批角色要连续出现几十个镜头、脸不能换的内容团队。

影视和动画的前期团队,想先用线稿和白模把节奏跑通,再决定哪些镜头值得精修。

只要一张小说封面或角色立绘:在首页直接说一句话出图更快,整套 IP 物料可以看「IP视觉包」。

需要长时间连续运动的长镜头或复杂打斗编排:图生视频目前适合几秒一段的短镜,长镜头只能拆开做。

希望丢进一整本书就自动吐出完整长片:这条线每到关键环节都会停下等你确认,默认按场推进。

目前做不到或要注意的

  • · 配音配乐、组装成片两个环节依赖的上游目前可能不可用,遇到时助理会如实说明,不会用文字冒充完成;前面的分镜、关键帧、镜头片段和台词时间轴照常交付。
  • · 角色一致性靠固定签名短语、专属 seed 和三视图参考图叠加来保证,能明显减少漂移,但做不到每一帧绝对不变,所以才设了逐镜比对这道关。
  • · 视频按秒计价,镜头越多花费越高。建议先跑一场做样片,看过计划卡上的花费预估再批量推进。

怎么开始

  1. 1打开首页,在右侧模板转盘里点「小说影视化」,确认后画布铺出 9 个环节;只想先试试,可以只勾剧本、角色卡、美术卡三环。
  2. 2在对话框贴一章或一场原文,说明题材和想要的画幅(默认 16:9,做竖屏推文就说 9:16)。
  3. 3看助理回的计划卡:打算怎么拆、分几步、大概花多少,同意了再开跑。
  4. 4在画布上一环一环推进,剧本、角色、分镜这几个确认点看完再点头;某一镜不满意,只重跑那一个节点。
  5. 5随时可以喊停,已生成的部分保留在画布上;失败的生成会自动退回金币。

可以直接说的愿望

「把我这章仙侠小说做成 16:9 动态分镜,先只拆剧本和三个主角的角色卡,别急着出图。」

「这一场是两人在雨夜天台对峙,按场拆分镜,重点做好对视和停顿的反应镜头。」

「用我已经锁好的两张角色卡,把第三场渲染成首尾帧关键帧,钩子镜头多给几张候选。」

去首页点「小说影视化」

和手工流程比,省在哪里

返工停在便宜的阶段

构图问题在黑白线稿和白模阶段就暴露,改的是一张线稿;手工流程里往往要到彩色关键帧甚至视频出来,才发现机位不对,只能整组重来。

不用每个镜头重新描述人物

角色签名、seed 和参考图一次建好,后面几十个镜头直接引用。手工写提示词时,每镜换个说法描述主角,脸就在不知不觉间变了。

时长从剧本就算好

台词折算的秒数从剧本一路传到分镜、配音和剪辑,不会在剪辑台上才发现画面比台词短了一截。

返工能点名到单镜

逐镜溯源表记着每一镜用的关键帧和 seed,改一镜不牵连整片,也不用回忆当初那张图是怎么生成的。

常见问题

小说转视频时,怎么保证主角每个镜头都是同一张脸?

三层叠加:8 维外观签名用固定短语、不换同义词;每个角色一个专属 seed;三视图作为参考图,也可以存成角色卡在提示词里直接引用。关键帧阶段还会逐镜和三视图比对,不一致就打回重渲。多人大远景仍然最容易出偏差,重要戏份建议用中近景。

可以直接贴小说原文吗,还是要先自己写剧本?

直接贴原文就行,第一环就是把原文拆成按场切分的结构化剧本,并按每秒 4.5 字折算台词时长。心理描写多的段落,可以让助理改成旁白或拆成反应镜头。剧本要你确认后才会进入出图环节。

3D 白模预演是做什么的,能跳过吗?

白模用来在出彩色图之前确认人物站位和机位,时间线可以回放。能跳过:在模板卡上取消勾选这一环即可。代价是构图问题要到关键帧阶段才暴露,那时返工要花更多金币。

生成的视频能直接拿去发小说推文吗?

镜头片段单段 3 到 8 秒,按分镜拼接。配音和组装成片两环的上游目前可能不可用,如果遇到,你会拿到镜头片段、台词时间轴和剪辑清单,需要在剪辑软件里完成最后一步。画幅默认 16:9,推文要竖屏的话,一开始就说明 9:16。

一章小说跑下来大概花多少?

取决于镜头数和画质:图片按张、视频按秒计价,提交时预扣,成功才结算,失败自动退回。开跑前计划卡会写出大概花费,也可以先只跑剧本和角色卡这几环看效果。

它和「剧本视觉化」产线有什么区别?

小说影视化从小说原文起步,默认 16:9,多一个美术圣经环节专门定世界观风格;剧本视觉化从写好的短剧剧本起步,竖屏 9:16,分镜按每段不超过 15 秒、每镜 2 到 5 秒切,最后还产出投放封面和 15 秒预告。

相关产线

相关行业

查看全部 8 条创作产线