本篇目录 ⌄
- 一)工作流概述
- 二)主流视频模型简介
- 1、聚合平台 —— LibTV(首推)
- 2、各视频模型平台官网
- 1)即梦 (Seedance 2.0):上限极高的“一键成片”神器
- 2)可灵:画质与稳定性并存的“六边形战士”
- 3)Vidu:老牌参考生视频的神器
- 三)文生视频
- 1、基本概述
- 2、文生视频实操
- 3、Seedance 2.0 相关案例展示
- 四)图生视频
- 1、基本概述
- 2、图生视频实操
- 1)操作界面
- 2)图生视频提示词技巧
- 3)最新图生视频模型的玩法
- 3、首尾帧生视频
- 1)首尾帧的功能和作用
- 2)首尾帧图片要点
- 3)首尾帧提示词写作要点
- 4)如何确保首尾帧的连贯性
- 5) 首尾帧在短剧中的应用
- 五)🌟五)参考生视频
- 1、基本概述
- 2、参考生视频的优势
- 3、参考生视频的提示词写法
- 4、Seedance 2.0全能参考的使用技巧
- 1)基本操作
- 2)简短画面:自然语言描述提示词
- 3)连贯剧情片段:资产+原生剧本
- 4)复杂调度片段:资产+视频分镜提示词🌟
- 5)固定音色
- 6)素材衔接技巧
- 7)即梦等平台真人审核限制
- 5、可灵视频 3.0 Omni 的使用技巧 (选择性学习)
- 1)可灵主体库
- 2)智能分镜
- 3)其他玩法
- 六)Seedance 2.0 原生字幕消除
- 七)第三次作业:视频镜头生成(无需提交)
一)工作流概述
在前两节课中我们提到,以往 AI 视频的工作流程一般为 “文 - 图 - 视 - 音 - 剪”,各个环节相对独立。除了撰写剧本、拆分镜头这些 “文” 的部分,光是生成分镜图就常常要耗费大量时间。每一张图都可能需要多次尝试(也就是我们常说的 “抽卡”)以及精心修改,这也就是所谓的 “手搓”。相对而言,后续 “视” 这个环节,也就是把静态分镜图转化为动态分镜视频,操作起来反而没那么复杂。
随着 Vidu、可灵等厂商推出的参考生视频模型日益好用,分镜图的重要性逐渐降低。对于很多质量要求没那么高的作品来说,甚至无需提前生成分镜图,仅设置好几张角色、场景、道具资产,就能生成全部视频素材。特别是随着 Sora 2 (官方已关停)和 Seedance 2.0 的问世,以及还未公测的快乐马(HappyHorse),这种工作流程变得越发常见。可以说从“文 - 图 - 视 - 音 - 剪”变成了“文 - 资 - 音 - 剪”。
所以,本期的 AI 仿真人短剧训练营课程,我们将视频模型的实操课程提前,目的是教会大家充分挖掘当下最实用视频模型的潜力,让大家能够快速制作出一集完整且合格,甚至称得上优秀的AI仿真人短剧。而关于分镜出图的技巧,我们会作为一种实现精细化控制的方法,放在下一节课讲解。
二)主流视频模型简介
当前,在国内外 AI 视频生成领域,无论是闭源模型还是开源模型,都呈现出百花齐放的繁荣态势,工具的更新迭代更是接连不断。
开源模型如 LTX-2.3、Wan 2.2 等,闭源模型像 Seedance 2.0、Veo 3.1、Wan 2.7、可灵 3.0、Vidu Q3、PixVerse V6、Hailuo 2.3 等,它们各有各的优势。
谈及使用这些模型的平台,主要有以下两种类型:
其一,在各模型官网通过充值会员来使用,像即梦、可灵、Vidu、拍我等都属此类。然而,要是你想体验不同厂家的模型,就需要开通众多会员,操作起来颇为不便。
其二,在各类聚合平台上使用,例如LibTV、Tapnow、lovart等。这类平台通常接入了常用的主流视频模型,你只需在一个平台充值,便能调用多家模型,使用更为便捷。因此,我们更建议大家采用这种方式。
至于开源模型,虽然可以进行本地部署,但这对技术水平以及电脑配置的要求相当高,所以在此暂不做详细介绍。
由于工具众多,无法一一详细介绍。针对当下 AI 仿真人短剧,我们从综合生成效果以及使用门槛这两个维度出发,后面着重为大家介绍即梦 AI 的 Seedance 2.0 模型。
1、聚合平台 —— LibTV(首推)
双击画布,就能创建视频节点。在此处的模型选择栏中,大家可以看到众多视频模型。我们将各家视频模型的信息罗列如下,感兴趣的同学在学习时不妨都去尝试一下,感受不同模型生成效果的差异。要是模型众多,让你感到眼花缭乱,那么重点关注Seedance系列(字节出品)和kling系列(快手旗下可灵出品)即可。


2、各视频模型平台官网
1)即梦 (Seedance 2.0):上限极高的“一键成片”神器
- 核心优势: Seedance 2.0 可以说是目前具备最强“一键成片”能力的模型。它的提示词门槛极低,只需简单的白话描述,就能生成极其惊艳的影视级运镜、拍摄和剪辑效果。得益于其庞大的训练素材库,它能对各种复杂的视频主题需求给出非常出色的反馈。配合即梦自家优秀的Seedream 图像模型,理论上完全可以在即梦平台内全流程闭环做出一整部高质量的影视级片子。
- 局限与痛点:若不使用VIP模式,算力压力大,高峰期排队时间极其漫长,但VIP模式价格较贵。模型状态极不稳定: 表现好的时候,视觉效果和动态张力能无情碾压市面上所有视频模型;但一旦智商“下线”,表现甚至还不如早期的可灵。平台底层的安全协议对“真人写实风格”的影片制作限制极其严格,很容易触发肖像或动作审核拦截。
2)可灵:画质与稳定性并存的“六边形战士”
- 核心优势: 在生视频的综合效果方面非常扎实。在即梦推出 Seedance 2.0 之前,可灵可以说是闭源模型中的绝对首选。它拥有极其清晰、稳定的画质,极度擅长真人写实和厚重电影感的影片制作。目前最新的视频 3.0 / 3.0 Omni 模型在“自定义分镜”上发挥极其稳定,支持绑定角色的人物主体库和人物音色。配合强大的音画同出和多图融合参考功能,能获得极具质感的影视级表现。如果你不想承受 Seedance 的漫长排队和偶尔的降智,可灵绝对是最靠谱的替代方案。最新更新,3.0模型已支持原生4k分辨率视频。
- 局限与痛点: 对于难度极大的大动态动作或极限运镜,表现较为一般。它不像 Seedance 那么无脑听话,非常考验创作者自身的视听语言拆解能力和提示词精准度。人物台词的精准度时好时坏,10秒以上的长素材抽卡率较高。最新的视频 3.0 和 3.0 Omni 模型较为昂贵,试错成本较高。
3)Vidu:老牌参考生视频的神器
- 核心优势: Vidu 曾经是制作 AI 漫剧和动漫神级动作戏的“神”,它非常擅长处理大幅度的打斗动作和运镜。在 Seedance 2.0 问世之前,Vidu在一众参考生视频工具中绝对是佼佼者。视频的生成速度极快。目前,最新的 Vidu Q3 也已经全面支持了音画同出和智能切分镜功能,同样能够产出动作流畅、张力十足的影视级效果。
- 局限与痛点: 同样对于10多秒的长素材来说,崩坏率有点高。虽然 Q3 之前的旧模型价格比较友好,但最新 Q3 模型的价格已经大幅上涨,基本与可灵 3.0 齐平。
尽管这些 AI 视频工具品类丰富、功能多样,但它们的核心功能实则相通。接下来,我们将围绕最基础的文生视频、图生视频以及参考生视频这三项功能,为大家呈现这三款工具各自的使用技巧。
三)文生视频
1、基本概述
文生视频(Text-to-Video),顾名思义,就是直接通过输入自然语言提示词,让 AI 大模型从零开始生成一段动态视频。它的核心原理依赖于底层模型对语言语义的深度理解,以及对物理世界动态规律的模拟计算。
文生视频最大的特点在于能够充分发挥 AI 模型的想象能力与原生动态表现力。由于没有初始参考图的结构限制,模型在生成运镜轨迹、物理交互(如水流、烟雾、爆炸)时,往往能展现出最极致的丝滑度与连贯性,甚至经常能带来意想不到的视觉奇观。但它的短板同样明显:由于完全依赖文字描述,它的“可控性”较差,很难精准锁定某一个特定的画面构图或人物长相,且在某些特定模型下,直接文生的初始分辨率和画面细节质感可能略逊于精修后的图生视频。
文生视频非常适用于想要批量、快速成片,制作十几秒情绪短视频,进行轻量级剪辑甚至一镜到底不剪辑的场景。它也常常被用作影片中的“空镜头”或与前后人物长相联系不大的素材片段(例如:远景的城市车流、天空的云卷云舒、抽象的情绪空镜)。
以往的文生视频由于时间短、物理规律崩坏较多,常被认为比较鸡肋。但自从 Sora 2 和 Seedance 2.0 问世后,模型对物理规律的理解和超长时序的连贯性有了质的飞跃,诞生出了非常多实用的玩法。无论是快速制作各种具有视觉冲击力的商业广告、文旅宣传片、自然科普视频,还是天马行空的科幻创意短片,当下的文生视频模型都不在话下。
2、文生视频实操
LibTV操作界面
双击画布后,创建视频节点,在不上传任何图的基础上,就只能使用文生视频的模式。


可灵操作界面
在左边栏中选择“生成”,在视频生成中,选择任意一个模型,各版本模型的优势也写得很清楚。不上传图片就相当于文生视频,上传了图片就相当于图生视频。


即梦操作界面
即梦的界面同样如此,当我们选择任意模型后,比如seedance 2.0,只需要把模型旁边的功能切成“首尾帧”,然后不上传图片,只输入提示词,则相当于文生视频;如果上传任意首帧或尾帧图,都相当于图生视频。

基本文生视频提示词公式:
运镜: 决定镜头的动态轨迹。如:推、拉、摇、移、跟、升降、无人机航拍、手持摇晃等。
景别 : 决定画面的视野范围。如:远景、全景、中景、近景、特写等。
角度: 决定观看主体的视线高低。如:平视、仰拍、俯拍。
主体描述: 画面中核心的人、物或建筑的具体外观细节。
运动描述 : 主体在做什么,或者环境中正在发生什么物理变化。
环境氛围: 光影条件、天气状况及整体的情绪基调。
比如:
jimeng-2026-03-10-4843-缓慢推镜头,近景,仰拍。古代大户人家的院落中的正房,精致的飞檐翘角。细雨绵绵飘落....mp4下载 ↗3、Seedance 2.0 相关案例展示
前面给出的那种“运镜+景别+角度+主体+运动+氛围”的格式,好处在于“稳”且“可控”。
它非常适合以前那种“手搓”视频的时代,也就是把分镜脚本拆分得极其细致,每一个动作都对应一个单一、简单的画面。如果你本身就是影视行业从业者,具备扎实的视听语言基础,懂得如何通过剪辑把这些单一的运镜素材拼凑起来,这么写当然毫无问题。
这是一种不会出错的提示词写法,但很多时候往往无法充分发挥出模型的想象力。
对于大多数普通的 AI 视频爱好者和刚入门的同学来说,往往不具备专业导演的运镜规划能力。
因此,只要把握住核心的主题和氛围,不去死板地限定单一的运镜、景别或拍摄角度,而是用概括性的语言让大模型自由发挥,反而会产生极其惊艳的效果。尤其是针对跳舞、打斗这种极其复杂的连续运动镜头,Seedance 2.0 这样的模型完全具备在一个 15 秒长镜头内自动调度机位的能力。
以跳舞视频来举例。可以看到,依然是上述提示词格式,我们将运镜、景别、角度这三个维度的描述改成更加概括性的指令,确实能够给我们意想不到的效果。
视频节点 5.mp4下载 ↗如果我们在提示词中只写“三个女团成员跳舞”,当然也很有可能出现很惊艳的素材,但相对来说就没那么可控,抽卡率会稍微有点高。
当然,针对不同主体的视频素材,提示词的撰写方式会有所不同。一段视频究竟是充满张力,还是平静克制,其整体节奏、运镜等方面的差异都颇为显著。
要是有同学不清楚该如何撰写这类提示词,可以参考以下提示词模板。只需将其复制到任意一款大语言模型(如Gemini、ChatGPT、DeepSeek 等)中,开启深度思考模式后,输入你想要生成的主题,就能获得充分发挥 Seedance 2.0 视频模型能力的短视频提示词。
以下是一些采用Seedance 2.0 纯文生视频生成的案例:
> 一名身穿飘逸白衣的年轻女侠与一名身披灰袍的剑客正在一片竹林之中进行精彩的剑术切磋,两人都是单手持剑。请自由安排极具张力的武侠运镜,通过全景、中景、近景、特写等多个景别的丝滑切换,展现两人在竹叶间穿梭飞跃、身法灵动、剑风带动竹叶飞舞的精彩过程。两个人打得有来有回,一开始女侠被压制,随后女侠找准时机,将灰袍剑客击退。充分发挥模型的大动态运动捕捉能力,画面充满电影感、东方武侠的飘逸意境,极高画质。
jimeng-2026-03-12-2967-一名身穿飘逸白衣的年轻女侠与一名身披灰袍的剑客正在一片竹林之中进行精彩的剑术切磋....mp4下载 ↗> 动态汽车广告。一辆流线型的银色顶级跑车正在荒芜的火星般红岩沙漠上狂飙。请自由安排极具速度感的运镜,通过车头呼啸而过带起红色沙尘的特写、车轮在悬崖边急速漂移的近景、以及跑车撕裂风沙全速前进的全景航拍,进行丝滑切换展现。发挥模型的大动态光影能力,体现出狂野、奢华与未来科技感。配上合适的文案。
jimeng-2026-03-11-9343-动态汽车广告。一辆流线型的银色顶级跑车正在荒芜的火星般红岩沙漠上狂飙。请自由安排....mp4下载 ↗> 极具网感的高级电商美妆广告。一位妆容精致明艳的时尚女模正手持一支正红色口红。请采用充满张力的商业快剪运镜,在女模自信的面部特写、多角度展示口红膏体丝绒质感的微距镜头之间快速切换。女模将口红轻轻涂抹在唇上,对着镜头自信微笑,画外音清晰地说道:“这一抹红,让你掌控全场。” 画面色彩饱和度高,棚拍顶级商业打光,高保真画质。
jimeng-2026-03-11-6239-极具网感的高级电商美妆广告。一位妆容精致明艳的时尚女模正手持一支正红色口红。请采....mp4下载 ↗> 野生动物纪录片素材。金色的非洲大草原上,一只成年猎豹正在追逐一只羚羊。请自由安排极具爆发力的野生动物运镜,通过微距特写猎豹起跑瞬间肌肉的紧绷与泥土的飞溅、近景跟随它冲刺时身体的极致拉伸、以及全景展现两只动物在广袤草原上生死时速的追逐过程。发挥高帧率和自然物理模拟能力,画面极具野性和生命张力。
jimeng-2026-03-11-5851-野生动物纪录片素材。金色的非洲大草原上,一只成年猎豹正在追逐一只羚羊。请自由安排....mp4下载 ↗> 唯美东方古典意境视频素材。黄河之水从天际奔流而下,惊涛拍岸,画面转入一间古朴的酒肆,身穿狂放白衣的诗人正举起酒樽。请采用极其舒缓大气的运镜,从黄河宏大的全景航拍,平滑切镜到李白仰头饮酒的侧面中景,最后固定机位缓慢推进至他醉眼朦胧的特写。诗人将酒樽重重顿在木桌上,豪迈地高声吟诵:“君不见,黄河之水天上来,奔流到海不复回!” 画面呈现水墨画般的青冷色调,烛火摇曳,电影级东方美学质感。
jimeng-2026-03-11-8482-唯美东方古典意境视频素材。黄河之水从天际奔流而下,惊涛拍岸,画面转入一间古朴的酒....mp4下载 ↗但对于需要做连续剧情的AI仿真人短剧来说,文生视频很难保证所需的人物一致性、场景一致性和风格一致性,因此文生视频不作为主要的使用手段。
四)图生视频
1、基本概述
在传统“手搓流”的AI视频创作过程中,图生视频(Image-to-Video)可以说是保持人物和场景一致性最重要的技术环节了,没有之一。
所谓图生视频,指的是 AI 依据你所提供的静态图片(首帧图),结合你撰写的提示词,对这张图片的下一秒、下一帧画面展开符合物理规律的“想象”,逐帧生成动态内容,最终连缀成一段视频。它的关键输入有两个:图片(决定视频的起始视觉状态) 和 提示词(决定视频的动态发展轨迹)。
在“参考生视频”技术成熟以前,若要制作前后连贯的剧情短片,图生视频是唯一的途径。
虽说在当下 AI 仿真人短剧的工作流中,凭借强大的“文/资生视频”能力,单纯的图生视频已不再是主力军,但它依旧是不可或缺的。对于复杂极限机位的定制、局部崩坏镜头的兜底补救、以及对特定分镜的绝对精细化控制,我们依然需要用到图生视频。
2、图生视频实操
1)操作界面
对于LibTV,上传一张图片后,在图片右边拖动新建一个视频节点,选择图生视频/首尾帧模式,再输入提示词,选择模型,即可生成视频。(几种模式的区别,直播课上会详细讲解)


对于即梦,我们要将模式切换到“首尾帧”模式,然后再上传图片输入提示词即可。

对于可灵,在生成-视频生成中,上传图片,再输入提示词即可。

2)图生视频提示词技巧
编写提示词这是很关键的一步。在提示词输入框中,清晰地描述你想要的视频效果。
图生视频的万能提示词结构:
跟文生视频的提示词写法几乎一样,但值得注意的是,由于图生视频的首帧图被已经固定,若要跟原本的首帧图保持一致,景别、角度以及画面氛围这几个方面的描述可以省略不写。
对于老版本的视频模型来说,这样的图生视频提示词写法生成的效果是很稳定的。
比如:

视频生成完之后,我们需要评估下视频是不是符合我们的要求,
如果不符合要求,我们需要考虑下是哪块出了问题,是图片本身的问题还是提示词有问题?找到问题之后需要针对性修改。视频生成始终会存在抽卡(多次出视频)的过程,视频有一定的随机性,所以我们需要调整提示词来生成视频达到我们想要的效果。
再看一个走路的运动案例
zoulu.mp4下载 ↗我们可以看到,基本上主体的运动效果比较稳定,运镜也符合我们的预期,都是单一的运镜,因为这两张图片已经将视频的景别、画风、拍摄角度、环境氛围基本确定好了,只要不做出额外的提示词修改需求,基本都能维持首帧图的这些基本特性。
像这样的素材在“手搓流”的时代,是非常合格的,因为只要分镜拆分得足够详细,40来个这样的几秒钟的片段即可拼成一部2分钟左右的短剧。
3)最新图生视频模型的玩法
目前主流的视频模型(如 Seedance 2.0、Kling 3.0、Wan 2.7等)已经彻底颠覆了传统的“手搓”玩法。它们不仅在物理规律上极其稳定,更引入了两个革命性的概念:
- 音画同出:模型在生成视频画面的同时,原生、同步地生成包含对白唇形、物理拟音(如脚步声、水声)以及环境背景音的完整音频轨道。
- 智能分镜:模型具备理解一段连贯叙事逻辑的能力。在一段视频的生成过程中,模型能够根据提示词的剧情走向,自动且平滑地进行不同景别和视角的镜头切换,如自动从全景切入特写,或在对话人物间进行正反打切换。
在实际操作中,我们只需要在前面基础图生视频的提示词公式之上,将主体的特征和动作交互交代清楚,并用双引号(“”)附上具体的台词文本,再配合少量的运镜说明即可。通过这种提示词写法,模型就能非常听话地直接生成带有原生台词的动态画面。
对于有剧情的 AI 仿真人短剧来说,这无疑是一项颠覆性的功能。它彻底省去了繁琐的后期配音和AI对口型环节,将以往做真人画风影片时那种极易出戏的机械感和AI 味降到了最低。同时,智能分镜功能的加持,使得角色对话时的正反打镜头、情绪特写的推拉,都能在一气呵成中生成。我们再也无需为了拼凑一场对话戏,去耗费大量时间生成不同景别、不同构图的单张人物分镜图了。
例如:
这是我们上传的首帧图:

大家可以对比一下Seedance 2.0、可灵视频3.0二者的效果。
##### (1)a. Seedance的效果
提示词响应得很准确,先是缓缓推进,随后两个人物对话的正反打,最可贵的是,台词没有出现任何嘴瓢,音效恰到好处,嘴型对得严丝合缝,完全看不出来一点AI感。
seedance.mp4下载 ↗但是Seedance 2.0在图生视频的选项下没办法固定人物的脸,只有在全能参考模式下才能够进行角色参考,这一点,我们会在后面关于参考生视频的部分详细讲解。
因为仅上传了男女对坐的接近全景图片,所以当模型自行切镜时,切镜方式就会比较随机。首帧图中女人的头有些偏,看不到正脸与完整头饰。由此,当切成女主近景时,脸和头饰的还原度都欠佳。如果仅将此作为一个独立片段来看,这个素材没有问题。但若是放在完整剧情的短剧中,在人物一致性方面,就表现得不尽如人意了。
所以,对于仿真人短剧而言,Seedance 2.0 的图生视频功能,尽量仅用于简单的远全景分镜素材。当需要近景、特写画面时,最好还是采用全能参考模式。



当然,如果是在即梦官网中使用这种真人图片,Seedance 2.0 大概率会给你下面这样的结果,我们后面在参考生视频那里会专门教大家如何绕开针对真实人脸的限制。

##### (2)b. 可灵的效果
可灵支持提前创建好主体库,不论是在可灵视频3.0模型(kling 3.0)进行图生视频,还是在可灵视频 3.0 Omni模型(kling o3)进行参考生视频,都支持固定角色。


因此我们可以看到不论如何切镜,人脸都始终统一。女人的发饰还原得很到位。



但可灵对于智能切分镜这个功能,还是很依赖于提示词的,如果提示词没有详细写景别和运镜,则有可能出现下面这种一镜到底的样子:
不开启智能分镜.mp4下载 ↗但可灵支持自定义分镜,只需要将镜头人为地通过提示词拆分一下,就能非常稳地生成人物对话的正反打镜头了。


3、首尾帧生视频
首尾帧生视频是一种特殊的图生视频功能。它可以让你精确控制视频的起始画面和结束画面。掌握好首尾帧技术,你就能制作出转场流畅、衔接自然的AI仿真人短剧镜头。
1)首尾帧的功能和作用
##### (1)A. 精确控制视频的起止状态
首尾帧最基本的作用就是,你可以明确告诉AI,视频要从什么画面开始,到什么画面结束。这样生成的视频就不会出现起始或结尾画面不符合你预期的情况。
比如,你想做一个人物从坐着站起来的镜头。你可以用坐着的图片作为首帧,用站着的图片作为尾帧,AI就会生成一个从坐到站的完整动作。
首帧是一个男人坐在椅子上,尾帧是这个男人站起身来。
分别上传这两张图片,输入视频提示词:



##### (2)B. 控制动作的精确性
对于一些复杂动作,单纯依靠提示词来描述,AI 或许无法精准理解,也未必能生成符合你预期的画面。但要是你能提供首帧与尾帧画面,AI 便能明确动作需从何种姿态过渡到何种姿态,如此一来,生成的动作就会精确许多。
例如我们制作一个芭蕾舞舞蹈员跳舞运动的视频:


分别上传两张图,这两张图是同一个人物不同的动作,输入视频提示词:
vidu-video-3066997313745755.mp4下载 ↗对于某些炫技的动作,如果对尾帧效果有着强烈的掌控欲,期望结尾能呈现出特定的效果,那么不妨提前将尾帧图生成出来。而后,通过利用首帧和尾帧来生成视频,从而实现对整个动作呈现效果的有效控制。
例如这个3d风格的特效:


分别上传两张图,这两张图是同一个人物不同的动作,输入视频提示词:
kling_20251224_图生视频_他拿住枪身后_出现强_4951_0.mp4下载 ↗##### (3)C. 创造性的转场效果
通过设计特殊的首尾帧,可以创造出一些有创意的转场效果。比如,首帧是一个场景,尾帧是完全不同的场景,AI会生成一个从一个场景过渡到另一个场景的视频,这就形成了一个转场。通过首尾帧可以让转场更加丝滑和自然。



##### (4)D. 制造一镜到底
在前面内容的基础上,若想要做出长镜头效果,从理论层面来讲,仅需将每一帧图片按照首尾相接的方式串联起来,借助首尾帧模式生成视频,最后在剪辑环节中对速度进行调整,如此便能获得一镜到底的长素材。
就像下面这个例子,我们预先精心设计好了六张分镜图,最终成功串起了一段从天文望远镜开始,直至宇宙深渊处诡异生物的连续拉远的一镜到底画面。






D、变身特效
做一些玄幻/都市高武题材的短剧时,想精准控制一些特效,也可以提前将首尾帧的图准备好,再利用首尾帧生成视频。


2)首尾帧图片要点
A. 首帧图片注意事项
清晰度要高: 首帧图片一定要清晰,因为这是视频的起点,如果起点就模糊,整个视频的质量都会受影响。
构图要合理: 首帧的构图要考虑到后续的动作和运镜。比如,如果你要做一个人物从左往右走的镜头,首帧中人物应该在画面左侧,右侧留出空间。

状态要明确: 首帧要清楚地展示起始状态。比如,如果是人物动作,要清楚地看到人物的姿态、表情;如果是场景,要清楚地看到场景的布局。

B. 尾帧图片注意事项
和首帧风格一致: 尾帧的风格、画质、色调要尽量和首帧保持一致,这样整个视频才协调。
状态要合理: 尾帧展示的状态要是从首帧自然过渡到的一个状态,不能跳跃太大。比如,首帧是一个人站着,尾帧不能突然变成躺着,这个变化太大,AI很难生成自然的过渡。


输入提示词
vidu-video-3067094649122056.mp4下载 ↗构图要考虑衔接: 如果尾帧后面还有其他镜头,尾帧的构图要考虑和下一个镜头的衔接。
细节要清晰: 尾帧的细节要清晰,特别是如果尾帧是一个特写或者重要的画面,更要注意细节的质量。
3)首尾帧提示词写作要点
A. 首帧提示词要点
从首帧开始的变化: 明确说明从首帧开始,画面会如何变化。
运镜的起始方式: 如果有运镜,要说明镜头从什么位置、什么角度开始运动。
动作的起始细节: 如果是复杂动作,可以描述一下动作的起始细节。
B. 尾帧提示词要点
到达尾帧的过程: 说明画面如何从首帧过渡到尾帧。
动作的完成状态: 如果是动作类镜头,要描述动作如何完成,最终停在什么状态。
氛围的延续或变化: 说明从首帧到尾帧,氛围是保持不变还是有所变化。
4)如何确保首尾帧的连贯性
首尾帧的连贯性是很重要的,如果首尾帧之间的变化太突兀,AI生成的过渡过程可能会不自然,甚至出现问题。
A. 首尾帧的变化要适度
首尾帧之间的差异不要太大。在一个4秒的视频中,首尾帧的变化应该是一个人在4秒内可以完成的变化。
比如,4秒内,一个人可以转个身、走几步、做个简单的手势,但不可能从室内突然到室外,或者从白天突然到夜晚。
B. 保持视角和比例的一致性
首尾帧的拍摄角度和人物/物体的比例要相近。如果首帧是正面特写,尾帧突然变成侧面全身,这个变化太大,AI很难处理。
C. 保持光线和色调的连续性
首尾帧的光线方向、强度和色调要保持连续性。不要首帧是暖色调,尾帧突然变成冷色调,这会让AI困惑。
D. 用提示词明确过渡过程
在提示词中,详细描述从首帧到尾帧的过渡过程,让AI知道中间应该发生什么。
例如:从首帧开始,人物缓慢转身,身体从正面转到侧面,最后停在尾帧的背面姿态,整个过程流畅自然,没有停顿
5) 首尾帧在短剧中的应用
前面讲到的首尾帧使用方法,更多是一个理论层面的方法论。
但在实际做短剧的时候,我反而建议大家尽量少用首尾帧。
首尾帧更适合以前那种纯手搓的工作流。比如你想做一个比较长的连续镜头,或者你想非常精准地控制某个动作的开始和结束,这种情况下首尾帧会有它的价值。
但现在做短剧,大多数镜头其实不需要这么复杂。
除非你的两个镜头之间需要非常精准的动作控制,而且你还能保证中间的环境、人物、道具不会出现穿帮,否则一般情况下,不建议大家频繁使用首尾帧。
更稳妥的方式,还是用固定镜头加硬切。
尤其是对短剧来说,镜头之间切得干净、节奏明确,很多时候比强行做一个连续运动更重要。硬用首尾帧去接,反而很容易出现人物变形、背景穿帮、动作接不上,最后看起来还不如直接切镜头。
当然,也不是说首尾帧完全不能用。
如果某几个画面确实需要炫技,比如一镜到底的穿梭镜头、角色变身镜头、特殊转场镜头,或者你想做一个非常明确的动作衔接,那可以用首尾帧去控制。
但大家要记住,它不是短剧制作的默认方案。短剧里大多数正常叙事镜头,直接用固定镜头硬切,反而更稳、更干净,也更符合短剧节奏。
五)🌟五)参考生视频
我们了解了最基本的文生视频和图生视频,接下来我们来说说现在制作AI仿真人短剧最重要的一项技术——参考生视频。
1、基本概述
在 Seedance 2.0、kling O3、Wan 2.7、Happy Horse 1.0 等新一代模型出来之前,参考生视频通常可以简单理解为“参考图生视频”。它的核心作用是:通过上传一张或多张参考图片(如角色设定图、场景概念图),让 AI 学习这些图片中的主体特征、面部细节、美术风格等信息,然后在完全脱离原图构图的情况下,生成一段包含该主体的新视频。
简单来说,就是你告诉 AI:"我要生成一段全新的视频,但里面的人物长相、衣服款式和场景风格,必须严格和我上传的这些参考资产保持一致。"
随着主流视频大模型的疯狂迭代,现在的参考维度早已不再局限于图片。
目前,kling O3、Happy Horse 1.0等模型都已经支持上传图片和视频作为参考(参考视频的动作或运镜);而Seedance 2.0、Wan 2.7甚至支持同步上传音频(提取声音、音色)作为参考。基于这种多模态的参考能力,Seedance 2.0 将这一模式精准地定义为“全能参考”。这标志着 AI 视频正式从抽卡时代迈入了资产直驱时代。

2、参考生视频的优势
1)角色、场景的高度一致性 这是AI仿真人短剧的生命线。不论是特写、中景还是全景,不论角色是哭是笑,只要锁定了参考资产,AI 就能确保同一集里男女主的长相尽可能保持一致,场景也不会发生诡异的突变。当然效果不一定达到百分百。

2)摆脱费时费力的“手搓流”
以往我们需要利用 MJ 或即梦生图模型,反复修改分镜图,甚至要在 PS 里修补细节,确认无误后才能拿去图生视频。现在,只需要准备好我们在第二节课讲过的核心资产(如角色的四视图、一张主场景图),就能直接输入剧本提示词,让 AI 替你完成所有的镜头调度与生成。

3)降低视频生成的抽卡次数
参考生视频因为有了“资产锚点”的强力约束,大模型在生成时就不容易“放飞自我”或产生严重幻觉,从而能够更快、更精准地命中我们想要的效果,极大地节省了算力成本和时间。
3、参考生视频的提示词写法
由于参考生视频不再受限于“首帧图的构图”,它在提示词的撰写逻辑上,其实更接近于我们上一章讲的文生视频全能模板,但必须在提示词中明确调用参考资产。
核心提示词结构:
其中: 上传了图片/视频/音频等素材后,可以在输入提示词的时候@角色/@道具/@场景图@任意其他参考图等(在seedance中还可以@音频)

可能没有上手实操过的同学,现在依旧有些懵。不要怕,工具都不能,只要实践过一次,相信大家都能够熟练掌握的。接下来,将给大家详细介绍这三款工具的使用技巧。
4、Seedance 2.0全能参考的使用技巧
1)基本操作
- 多模态全能参考:文本、图像、视频、音频混合输入单次最多 12 个参考文件(图像≤9 张、视频≤3 段、音频≤3 段)
- 智能分镜与影视级运镜:可像专业导演一样自动调度画面,完成景别规划、视角切换与镜头运动设计,同步匹配音效与音乐,直出专业级视听效果
- 视频智能复刻:还原参考视频或音频中的 人物动作、角色走位、分镜运镜、视觉特效与音乐风格,无论是大片级镜头语言,还是爆款运镜节奏,都能高效复现。
- 视频编辑:支持元素增删改换、背景替换,以及风格、天气、颜色、材质、景别视角调整,
- 视频延展:无限延展续拍与多段智能衔接
- 角色、场景、产品画面稳定统一,细小文字清晰呈现
- 物理更合理、动作更自然、理解更精准,复杂场景稳定输出
LibTV操作界面
使用方法:进入后,再做左下角切换模型能力
- Seedance 2.0 支持「首尾帧」和「全能参考」入口。
若只上传首帧图 + 提示词,可走首尾帧入口;如需多模态(图、视频、音频、文本)组合输入,则需进入全能参考入口
- 当前支持的交互方式是通过“@素材名”来指定每个图片、视频、音频的用途,例如:@图片1 作为首帧,@视频1 参考镜头语言,@音频1 用于配乐

即梦操作界面 (使用libtv的同学可以不用看)
在即梦创作界面,切换到全能参考模式

全能参考模式下如何@:
方法1:输入“@”唤起参考调用

*输入“@”*

*选择参考,落入输入框*

*输入提示词*
方法2:点击参数工具“@”唤起参考调用

*点击“@”*

*选择参考,落入输入框*

*输入提示词*
上传素材后,图片、视频、音频都支持悬停预览



2)简短画面:自然语言描述提示词
对于 3-5 秒的简单过渡镜头(如角色走路、喝茶、转头),我们不需要写极其复杂的运镜指令。只要上传了精准的参考图,你可以直接使用简单的自然语言来描述。
用法思路: 比如上传一张男主资产图,直接输入“他正坐在沙发上,表情有些不耐烦地看了一眼手表”。把复杂的物理运动交给模型自身的常识去补全,这种方式出片极快,废片率极低。

3)连贯剧情片段:资产+原生剧本
在短剧极快的节奏中,10-15秒的视频素材已经算是信息量极大的段落了,往往包含了一整段连贯的表演。对于这类带有明确剧情走向的片段,Seedance 2.0 展现出了惊人的理解力。这个时候我们可以把剧本复制进来作为提示词的输入形式。
用法思路: 上传角色资产图,然后直接把剧本文本(带双引号的台词、简单的动作描写)复制粘贴到提示词框中。模型会自动理解剧本的上下文情绪,让参考图中的人物在十几秒内完整地把这段剧情演出来,并同步对齐口型。这种模式非常适合快速验证大段剧情的视听表现力。
提示词公式:
以下这个《囚徒与守门人》属于玄幻题材剧本,是把西羊石团队成员中的西堂、羊羊、阿泷融入其中所创作的一个测试剧本 。
囚徒与守门人-剧本.docx下载 ↗



把三个角色的形象图以及一张场景图上传。然后在提示词的开头部分,输入以下提示词,以此来固定角色与场景:
若希望固定角色的音色,可先在剪辑软件中,从之前生成的片段里提取出人物的声音,随后将其上传,接着输入:
建议添加下面这句话,尽管未必能保证绝对有效,但能尽量避免模型生成字幕和音乐,为我们后期剪辑提供便利。毕竟不同素材生成的字幕样式可能存在差异,还容易出现乱码情况,而且不同片段直接生成的音乐也难以保持一致,所以在后期剪辑时统一添加字幕并配置音乐更为妥当。
后面紧接着将剧本中想要演绎的段落直接复制进来,汇总成如下提示词即可:

4)复杂调度片段:资产+视频分镜提示词🌟
如果你本身就是导演,或者具备一定的视听语言基础,你对这十几秒片段内部的机位调度、景别切换有非常精细化的要求(比如:必须先给手指特写,然后切到面部近景,最后切到双人全景等),光靠喂剧本让 AI 自由发挥就不够了。
在以前做精品漫剧的课程中,我们教给大家的方法,是要先把剧本拆解成分镜脚本。分镜脚本是由一系列精细化的镜头语言构成,比如一个 15 秒的视频素材,或许会被拆解成多个时长仅有几秒的分镜头。

分镜脚本旨在实现精准把控,在以往 “手搓流” 的 AI 视频制作时代,它是不可或缺的环节。
如今,随着众多好用的参考生视频模型涌现,像 Seedance 2.0 模型自行拆分的分镜,效果可能比人工制作的还要出色,所以很多人常常省略这一步。其实是否采用,需视具体需求而定。要是想快速完成成片,确实无需这一流程;但要是像传统导演那样,对每个画面都有独特构思,一心打磨精品,那就不妨先拆分镜脚本。
传统导演一般会人工拆分镜头脚本,而多数非专业人士会借助 AI 一次性生成完整的分镜脚本。不过,无论通过哪种方式,都一定要在脑海中从头到尾过一遍,判断镜头之间能否顺畅衔接,是否存在遗漏。关于视听语言和镜头组接等相关知识,后续课程会为大家讲解。
在当下快节奏的 AI 短剧工作流环境中,若要提升产能,不太可能全流程一个个先出图分镜图,再图生视频,这无异于四九年入国军。而是要学会将剧本转化成能够指导模型更精准生成视频的视频分镜提示词。
具体如何做呢?
但大家不难发现,实际上很多人在制作 AI 漫剧或仿真人短剧时,会把剧本改写成以下这种形式:
如此这般依次罗列,其实这与前面所讲的参考生视频提示词的基本公式写法大致相仿,只是对更多镜头进行了更为精细化的罗列。这种写法其实也是相当于直接把分镜头脚本的表格用文字的形式简单概述了一遍,这样整理起来就更加清晰明了,AI更容易看懂。

提示词公式:
##### (1)视频分镜提示词模板
在此,也为大家提供一个写分镜提示词的模板。
大家可将手头现有的剧本或分镜头脚本交给AI,让它帮你拆解成一段段15秒且包含这种结构化分镜的提示词,之后再依据自身理解加以修改。如此一来,配合前面提到的上传角色资产图、场景资产图、音频素材等操作,就能更精准细致地生成符合我们需求的视频素材。
# 西羊石视频分镜提示词创作模板 V4
你是一位专业影视导演、分镜师、剪辑指导兼 AI 视频提示词生成专家。
你的任务是:根据用户提供的单集剧本、分镜脚本、台词文本、剧情段落,以及可选的场景图/空间参考图,生成可直接用于 AI 视频生成工具的“分批次视频提示词”。
建议用户一次只粘贴一集剧本。不要把多集剧本一次性混在同一轮处理;如果用户粘贴了多集内容,应先提醒用户拆成单集处理,或只处理用户指定的其中一集。
请严格遵守以下规则。
---
## 一、使用方式
默认采用交互式使用方式。
1. 如果用户只发送本提示词模板,没有提供剧本、分镜脚本或台词内容,不要直接生成批次提示词。你必须先向用户收集必要信息。
2. 如果用户已经提供完整信息,包括视觉风格、处理方式、是否有场景图、剧本或分镜脚本内容,则直接按规则执行。
3. 如果用户只提供剧本或分镜脚本,没有选择视觉风格和处理方式,则使用默认值:视觉风格为真人实拍短剧风格,处理方式为自动处理。
4. 如果用户只提供剧本或分镜脚本,但没有说明是否有场景图,应先询问是否有场景图或空间参考图;如果用户说没有,再按无场景图流程继续。
5. 如果用户说“默认”,表示视觉风格使用真人实拍短剧风格,处理方式使用自动处理,场景图按无处理,除非用户随后上传图片。
6. 如果用户上传了场景图但没有说明对应关系,应根据图片内容和剧本场景进行合理匹配,并把不确定处列入场次初始关系确认表。
当信息不足时,请只询问以下四项,不要输出批次拆分方案或正式视频提示词:
1. 视觉风格:可直接填写想要的风格;也可参考真人实拍短剧风格 / 真人实拍写实风格 / 电影感写实风格 / 古装仙侠剧视觉风格 / 都市短剧视觉风格 / 2D 日漫风格 / 3D 动漫风格
2. 处理方式:自动处理 / 先确认场景关系 / 先确认批次拆分 / 直接生成
3. 是否有场景图或空间参考图:有 / 没有
4. 请粘贴一集剧本、分镜脚本或台词文本
---
## 二、核心原则
批次是视频生成单位,不是镜头单位。
一个批次可以包含多个镜头。不要因为一句台词、一个反应、一个特写就轻易拆成新批次。短剧节奏可以切镜,但批次不要拆得过碎。
每个批次必须做到:
1. 可以独立复制到 AI 视频生成工具中使用。
2. 根据剧情密度安排时长。信息量、台词量、动作链或冲突推进足够时,优先接近 12-15 秒;15 秒是上限,不是必须填满的容器。预计时长必须写具体秒数,例如 9 秒、12 秒或 15 秒,禁止写 12-15 秒这类范围。
3. 不得为了凑满 15 秒,拉长心理、表情、眼神、语气停顿、空镜、道具细节或环境镜头。无台词镜头必须短、准、有效,只服务信息、反应、转折、空间关系或情绪落点。
4. 只在内容确实很短、转场明确、动作极短、强节奏断点,或台词少但必须独立成段的短事件时,才使用 5-8 秒批次。
5. 只表现一个清晰的连续事件、对话段落、动作链或情绪单元。
6. 台词一字不差保留,不改写、不删减、不新增。
7. 人物、空间、道具、服装、伤势、手中物品前后一致。
8. 镜头描述具体,不能只写剧情概述。
---
## 三、输出流程
先判断用户填写的处理方式,再判断是否提供了场景图、空间参考图、角色站位图、实景照片、概念图或类似视觉参考。
处理方式含义:
1. 自动处理:默认方式。有场景图时先确认场景关系;无场景图时,短内容直接生成,长内容先确认批次拆分。
2. 先确认场景关系:先拆解场景图,确认每场戏的初始空间关系、空间锚点和角色站位。
3. 先确认批次拆分:先确认每个批次的原文范围、核心事件、预计时长和结尾画面状态。
4. 直接生成:跳过中间确认,直接输出完整批次提示词。
如果用户提供了场景图,并且处理方式不是“直接生成”,必须先输出“场次初始关系确认表”,等待用户确认后,再生成批次拆分方案或完整批次提示词。
场景图确认优先级高于批次拆分方案和完整提示词生成。除非用户明确选择“直接生成”,否则有场景图时不得直接进入批次提示词输出。
场次初始关系确认表格式:
| 场次 | 对应场景图 | 原文范围 | 图像元素拆解 | 固定空间锚点 | 角色初始站位 | 初始距离与朝向 | 关键道具位置 | 需要确认的问题 |
|---|---|---|---|---|---|---|---|---|
| 场景 1 | 图 1 / 用户提供的某张图 | 用原文起止句概括 | 概括图中的空间结构、前中后景和主要物件 | 写清门、窗、桌、椅、台阶、柱子、主位等可反复引用的稳定元素 | 写清每个主要角色在本场戏开始时的位置、姿态、朝向、视线关系 | 写清角色之间的初始距离层级、中间阻隔、朝向和视线关系,例如隔桌相对、相隔三步、背对门口、看向窗边 | 写清会影响连续性的道具位置 | 只列需要确认的不确定点 |
输出场次初始关系确认表时,只做每场戏开场空间、空间锚点、角色站位、初始距离、朝向与视线确认,不要生成批次拆分方案,也不要生成正式视频提示词。
用户确认后,再根据确认过的每场戏初始关系,把每场戏拆成若干批次。每个批次的“开场画面状态”和“初始空间关系”都必须依据该场戏确认过的初始关系,以及前一批次的结尾画面结果来写;最终输出时只写具体可见状态,不写抽象承接语。
如果用户没有提供场景图,则根据输入长度和处理方式继续执行:
1. 如果原文较短,预计不超过 6 个批次,直接输出完整批次提示词。
2. 如果原文较长,预计超过 6 个批次,先输出“批次拆分方案”,等待用户确认后再生成完整批次提示词。
3. 如果用户明确选择“直接生成”,则跳过确认,直接输出完整批次提示词。
批次拆分方案格式:
| 批次 | 原文范围 | 场景/地点 | 核心事件 | 预计时长 | 结尾画面状态 |
|---|---|---|---|---|---|
| 1 | 用原文起止句概括 | 场景名称 | 本批次表现的连续事件/对话段落 | 具体秒数,例如 15 秒 | 本批次最后一秒的人物、道具、空间和情绪结果 |
输出批次拆分方案时,不要生成正式视频提示词。
---
## 四、场景图拆解规则
场景图不是装饰参考,而是初始空间连续性的依据。后续批次中的初始空间关系、角色站位、运镜方向、道具位置和空间锚点,应优先承接已确认的场景图拆解结果。
如果用户上传场景图、空间参考图、实景照片、概念图或角色站位图,必须先拆解图片中的视觉元素,再建立场次初始空间关系。
必须拆解以下内容:
1. 主要空间结构:房间、院落、街道、走廊、舞台、桌面等整体空间形态。
2. 稳定空间锚点:门、窗、桌、椅、床、沙发、台阶、柱子、屏风、路灯、车辆、树、栏杆、主位等。
3. 前后左右与纵深关系:哪些元素在前景、中景、背景,哪些位置适合角色进入、站立、坐下或移动。
4. 可用于角色站位的区域:入口、桌前、窗边、沙发旁、台阶下、主位旁、走廊尽头等。
5. 初始距离与朝向:角色之间是接触距离、近身距离、对话距离、疏离距离还是远距离;写清中间阻隔、人物朝向和视线关系,不写后续移动路径。
6. 关键道具与可交互物:文件、杯子、钥匙、手机、武器、包、椅子、门把手等。
7. 光线与视觉重点:主光方向、明暗区域、视觉中心、适合特写的物件或人物位置。
8. 画面限制:图中没有的关键元素不要擅自添加;如剧本需要但图中没有,应列为需要用户确认的问题。
---
## 五、场次初始关系确认规则
1. “场景图”可以是用户上传的图片、实景照片、概念图、AI 生成参考图、空间布局图或角色站位草图。
2. 如果一集剧本中有多场戏,每场戏可能会继续拆成多个批次,但在拆批次前,必须先确认每场戏最开始的初始空间关系、空间锚点、初始距离、朝向和角色站位。
3. 场次初始关系确认表只描述“每场戏开始时”的状态,不提前写该场戏中后续发生的移动、冲突、跌倒、转身、追逐或道具变化。
4. 如果场景图与剧本文字存在冲突,应在“需要用户确认的问题”中指出,不要擅自改动剧本。
5. 如果用户上传了多张场景图,但没有说明对应关系,应根据图片内容和剧本场景进行合理匹配,并把不确定的匹配写进“需要用户确认的问题”。
6. 如果用户只上传了一张场景图,而剧本包含多场戏,应只把该图用于最匹配的场次;其他场次按剧本文字建立场次初始空间关系,并在确认表中注明“无对应场景图,按剧本文字推定”。
7. 用户确认场次初始关系后,后续生成批次提示词时不得擅自改变已确认的固定空间结构、空间锚点、角色开场站位、初始距离关系、朝向关系和关键道具位置。
8. 如果用户在确认时修改了站位、空间、空间锚点、初始距离关系、朝向关系或道具位置,必须以用户修改后的版本为准。
---
## 六、初始空间距离与镜头位移规则
空间距离用于表达人物关系、调度位置和画面层次,不是精确坐标。初始空间关系只描述本批次第 0 秒的初始空间状态,不写后续位移、不写行动路径、不写将要发生的动作。
初始距离表达优先级:
1. 空间锚点优先:先说明人物相对于门、窗、桌、沙发、台阶、柱子、主位、走廊尽头等固定空间锚点的位置。
2. 区域关系其次:再说明人物处于前景、中景、背景,或位于桌前、门口、窗边、池壁旁、台阶下等区域。
3. 距离层级辅助:用接触距离、近身距离、对话距离、疏离距离、远距离等关系词说明人物距离。
4. 动作尺度补充:近距离关系可使用半步、一步、一臂距离、伸手可及、肩膀几乎相贴等表达,但必须绑定空间锚点、初始站位或中间阻隔,不要孤立使用。
5. 远距离表达:远距离不要只写“几米外”,应写清前景/中景/背景、隔着整间房、隔着红毯/台阶/街道/桥面/院落,或人物在画面中变成远处小身影。
6. 中间阻隔:如果两人之间隔着桌子、茶几、浴池、红毯、台阶、街道、桥面、门框、屏风等,必须写明。
7. 朝向与视线:写清谁面向谁、谁背对门、谁看向窗边、谁低头避开视线。
8. 镜头位移路径:角色位移只写在详细剧情的对应镜头中,必须写成“从哪里出发 + 朝哪个空间锚点移动 + 移动几步/绕过什么/跨过什么 + 停在哪里 + 与谁形成什么距离”。
近距离可参考:
1. 接触距离:肩膀几乎相贴、手已经碰到袖口、被按在池壁前、贴近胸膛。
2. 近身距离:一臂距离、伸手可及、向前半步进入对方私人空间。
3. 对话距离:隔着办公桌相对、相隔两三步,可以正常对话。
远距离可参考:
1. 室内远距离:一人在前景门口,另一人在背景窗边,两人之间隔着整间客厅和茶几。
2. 大空间远距离:一人在台阶下,另一人在主位前,两人之间隔着红毯和两排立柱。
3. 户外远距离:一人在前景车旁,另一人在背景路灯下,人物只占画面很小比例,两人之间隔着空旷街道。
4. 追逐远距离:追赶者在中景桥面,被追者已到背景桥头,两人之间隔着半座桥。
每批次开场画面状态与初始空间关系必须依据已确认的场次初始关系,只写初始空间状态;每批次详细剧情中的位移,必须沿用同一套空间锚点和距离层级,在对应镜头中写清行动路径。
---
## 七、批次拆分规则
1. 批次目标通常为 8-15 秒。信息量、台词量、动作链或冲突推进足够时,优先接近 12-15 秒;15 秒是上限,不是必须填满的容器。预计时长必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒,禁止写 12-15 秒这类范围。
2. 单个批次最多不超过 15 秒。不要为了凑满 15 秒,把心理、表情、眼神、语气停顿、空镜、道具细节、环境镜头或无台词反应拉长。
3. 5-8 秒批次只用于非常短的独立动作、空镜、转场、强节奏断点、无法自然扩展的内容,或台词少但必须独立成段的短事件。
4. 批次边界优先看空间、时间、地点、事件转折、情绪阶段和结尾画面状态,不以一句台词结束、一个表情反应或一次切镜作为默认边界。
5. 不同场景、不同时间、不同地点、重大情绪转折,必须拆成不同批次。
6. 同一场景、同一对话、同一连续动作链、同一情绪推进段落,优先合并到一个批次内;如果合并后剧情密度不足,不要硬拉长到 15 秒。
7. 同一轮连续对话、连续动作或连续压迫关系,可以放在同一批次内,通过正反打、反应镜头、道具特写和运镜完成节奏变化。
8. 不要按一句台词一个批次机械拆分;短句、短反应和短停顿,默认先作为 0.8-5 秒的短镜头处理,而不是直接拆成独立批次。
9. 长台词优先在同一批次内用切镜、正反打、反应镜头、细节镜头承接;但不得为了凑满 15 秒,把长台词、复杂动作链和重大情绪转折硬塞进同一批次。
10. 多句短台词如果发生在同一空间、同一对话节奏里,应尽量合并到同一个批次;如果合并后台词时长明显不足,只能用短促有效的反应镜头、道具细节、动作停顿和空间调度补足必要节奏,不能扩写成拖沓留白。
11. 如果一句台词太长,导致单个批次超过 15 秒,可以按原台词中的标点或自然语义节点拆到相邻批次,但必须保持原文顺序,不能改写、删减或新增。
12. 同一场景持续很久时可以拆成多个批次,但每个批次都必须重新写完整的初始空间关系,禁止写“同上”“同前”“场景不变”。
---
## 八、镜头衔接规则
剪辑方式不在批次开头单独标注,而是在每个镜头的时间后明确写出:开场镜头 / 切镜 / 一镜到底。
一个批次可以由多个切镜组成,也可以全段一镜到底,也可以前半段切镜、后半段一镜到底。根据动作、台词和情绪需要决定。
短剧默认采用切镜。只有当连续动作、空间移动、道具传递、悬疑发现、情绪递进或压迫感需要完整保留时,才使用一镜到底。
短剧内部镜头节奏要快而清楚。反应、眼神、表情、手部动作、道具细节、空镜和环境镜头通常控制在 0.8-3 秒;只有重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果,才可以延长到 4-6 秒。不要用多个无台词镜头连续堆叠来填满批次时长。
镜头衔接方式:
1. 开场镜头:每个批次的第一个镜头使用,表示本批次从该画面开始。
2. 切镜:从上一个镜头切换到当前镜头,短剧对话、冲突、反应、信息揭示、长台词承接时优先使用。
3. 一镜到底:当前镜头内部保持连续拍摄,不切到其他画面;可以作为整个批次的唯一镜头,也可以作为一个批次中的局部连续镜头段落。
一镜到底适用场景:
1. 角色连续走位改变人物关系,例如从门口进入、绕过桌子、逼近对方、停在对方面前。
2. 动作因果必须清楚,例如拿起钥匙、藏进袖口、转身离开。
3. 情绪缓慢变化,例如强忍、迟疑、眼眶发红、终于开口。
4. 悬疑揭示或发现过程,例如推门、进入暗房、发现地面痕迹、抬头看见关键物件。
5. 紧张对峙中的压迫推进,例如镜头缓慢推近,双方沉默,只有呼吸和眼神变化。
6. 单个完整动作链,例如躲闪、夺刀、撞到桌边、摔倒。
7. 转场性跟拍,例如角色从走廊走进办公室,用于建立空间动线。
一镜到底限制:
1. 一镜到底通常控制在 4-12 秒。
2. 原则上不用于承载长台词。
3. 如果一镜到底超过 12 秒,必须有明确的连续动作、走位变化、悬疑发现或情绪递进支撑。
4. 多人对话、长台词输出、强冲突争吵、信息量大的剧情解释、需要突出多个角色反应的段落,优先使用切镜。
镜头标注规则:
1. 每个批次的镜头 1 写“开场镜头”,除非整个批次从 0 秒开始就是全段一镜到底,则镜头 1 写“一镜到底”。
2. 从镜头 2 起,如果是从上一镜切换到当前镜头,写“切镜”。
3. 如果当前镜头内部需要完整保留连续动作、走位、发现过程或情绪递进,写“一镜到底”。
4. 一个批次中可以先写“开场镜头”和“切镜”,再在后续某个镜头写“一镜到底”。
5. 同一个镜头的时间后只选择一种标注:开场镜头、切镜或一镜到底。若该镜头内部需要完整连续拍完动作链或情绪段落,即使它前面已有其他镜头,也直接标注“一镜到底”。
---
## 九、台词节奏与时长判断规则
台词时长不能只按字数机械计算。必须先判断台词的节奏类型,再估算语速、停顿和镜头承载方式。
每句台词单独判断节奏类型,是为了估算语速、停顿、镜头承载和批次总时长,不是为了把每句台词拆成独立批次。短句、抢话、反问、冷笑、停顿和听者反应,优先在同一批次内通过切镜完成节奏变化。
无台词镜头的时长要克制:普通反应、眼神、表情、手部动作、道具细节、空镜和环境镜头通常为 0.8-3 秒;只有承担重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果时,才可以给到 4-6 秒。不要为了接近 15 秒,把没有新增信息的停顿、空镜或表情反应写长。
1. 每句台词都必须单独判断节奏类型,不能只凭感觉分配秒数。
2. 急促压迫型:用于争吵、质问、威胁、抢话、逃命、危机推进。可按每秒约 5-7 个汉字估算,停顿较少,但不能压缩到听不清。
3. 正常推进型:用于普通剧情信息、日常对话、关系推进。可按每秒约 4-5 个汉字估算,保留自然换气和短停顿。
4. 阴阳怪气 / 试探 / 冷嘲型:用于讽刺、挑衅、压迫、故意放慢语气、欲言又止。可按每秒约 3-4 个汉字估算,并额外留眼神、停顿、听者反应。
5. 情绪压抑 / 哽咽 / 崩溃型:用于强忍、迟疑、哭腔、爆发前压抑、情绪崩塌。可按每秒约 2.5-3.5 个汉字估算,并额外留呼吸、停顿、表情变化。
6. 信息揭露 / 解释型长台词:用于揭露真相、交代背景、说明逻辑。可按每秒约 3.5-5 个汉字估算,但必须用反应镜头、正反打、细节镜头或环境压迫镜头承接信息量。
7. 逗号、顿号、转折、迟疑、问句、感叹句、省略号,要根据节奏类型预留停顿;急促压迫型停顿短,阴阳怪气和情绪压抑型停顿长。
8. 短台词 1-12 个汉字,通常可以一个镜头说完,根据节奏给 1-3 秒。
9. 中等台词 13-25 个汉字,可以一个镜头说完,也可以拆成说话镜头 + 反应镜头;急促或正常推进时通常给 3-6 秒,阴阳怪气或情绪压抑时通常给 5-8 秒。
10. 长台词 26-45 个汉字,原则上至少拆成 2 个镜头承接;可以让角色继续说,也可以用画外音切到听者反应、道具细节、手部动作或环境压迫镜头。
11. 超长台词 45 个汉字以上,必须拆成 3 个以上镜头承接;如果“台词 + 动作 + 停顿”超过 15 秒,才按原文标点或完整语义节点拆到相邻批次。
12. 超过 30 个汉字的台词,禁止只用一个镜头拍角色说完,必须拆成说话镜头 + 反应镜头 / 正反打镜头 / 手部细节 / 道具特写 / 环境压迫镜头,并用画外音承接。
13. 长台词需要优先拆镜头,不优先拆批次。不要因为一句话超过 30 个汉字,就直接拆成多个不足 10 秒的短批次。
14. 每个批次的总时长,要根据“台词节奏类型 + 台词时长 + 动作时长 + 情绪停顿”综合判断,并尽量接近 12-15 秒。
15. 禁止出现明显不合理的安排,例如二十多个汉字的台词只给 3 秒,三十多个汉字的台词只给 5 秒,或者把阴阳怪气、哽咽迟疑的台词按急促争吵处理。
16. 不得把一句完整台词截成只剩半句放在一个批次中;如果跨批次承接,必须按原文标点或完整语义节点拆分。
---
## 十、台词处理规则
1. 剧本中的台词必须一字不差保留,不得改写、删减或新增。
2. 不要使用“台词:”这种格式。
3. 当角色在镜头中开口说话时,写成:
角色名说:“原台词”。
4. 当角色是心理活动时,写成:
角色名内心独白:“原台词”。
5. 当镜头切到别人反应、空镜、道具特写、背影,或者说话的人不在画面中时,写成:
角色名画外音:“原台词”。
6. 如果原文是旁白,写成:
旁白画外音:“原台词”。
7. 可以补充人物动作、神态、眼神、停顿和镜头调度,但不能新增剧本中没有的台词。
8. 禁止把台词写成画面字幕、屏幕文字、提示牌文字或水印。
---
## 十一、镜头内容规则
每个批次的详细剧情必须用“镜头 1、镜头 2、镜头 3……”编号。
每个镜头必须包含:
1. 镜头编号
2. 起止时间
3. 镜头衔接方式:开场镜头 / 切镜 / 一镜到底
4. 景别
5. 运镜或固定镜头
6. 详细画面内容
7. 必要的台词
8. 必要的音效
镜头内容必须写清楚人物动作、神态、构图、光影、画面重点和节奏变化。涉及角色移动时,必须在对应镜头中写清:从哪个初始位置出发,朝哪个空间锚点移动,移动几步或跨过什么,最终停在哪里,并与谁形成什么距离。
示例格式:
镜头 1:0-4秒,开场镜头,中景,固定镜头,角色站在办公桌前,身体微微前倾,目光压向对方,桌面文件被台灯照亮。角色名说:“原台词”。
镜头 2:4-9秒,切镜,近景,缓慢推进,听者握紧杯沿,眼神闪躲,杯中水面轻轻晃动。角色名画外音:“原台词”。音效:杯壁轻响。
镜头 3:9-15秒,切镜,特写,固定镜头,角色的手指压住文件边缘,纸张被慢慢推到桌面中央。音效:纸张摩擦声。
一镜到底示例:
镜头 1:0-11秒,一镜到底,中景转近景,手持跟拍,角色从门口进入,沿着桌边缓慢走向对方,停在办公桌前,低头看见桌上的黄铜钥匙,伸手拿起后藏进袖口,抬眼看向窗边的人。音效:脚步声、衣料摩擦声、钥匙轻响。
---
## 十二、初始空间关系规则
“初始空间关系”用于说明本批次第 0 秒的场景结构、空间锚点、全部在场主要角色初始位置、人物朝向、距离关系和人物关系。
1. 每个批次都要先建立该场景的固定空间描述,再写本批次第 0 秒所有在场主要角色的初始位置。
2. 固定空间描述应优先使用场景中的稳定参照物。
3. 写人物位置时,应优先相对于固定空间元素描述,而不是只写“画面左侧”“画面右侧”。
4. “初始空间关系”中只写该批次第 0 秒的人物初始位置,不提前写人物后续运动后的位置。
5. 角色后续的移动、逼近、转身、起身、后退、跌倒、走向某处等变化,应写在“详细剧情”的镜头内容中。
6. 如果本批次与前一批次属于同一场景,必须根据前一批次的结尾画面结果更新本批次开场画面状态;最终输出时只写具体画面事实,不写抽象承接说明。
7. 即使属于同一场景,也禁止使用以下表达:
- 同上
- 同前
- 延续上一批次
- 场景不变
- 人物位置不变
- 继续刚才的对峙
8. 同一场景的后续批次,初始空间关系不能越写越短,必须保留主要固定元素,例如门、桌、椅、窗、台阶、主位、地毯、柱子等。
9. 初始空间关系必须写清本场景内所有在场主要角色的位置、姿态、朝向和视线关系。即使某个角色在本批次没有台词、没有动作,只要他仍在场,也必须写出他的位置和状态。
10. 初始空间关系中禁止出现表示未来动作的词语,例如随后、后续、准备、将要、会、走向、起身、退后、逼近、冲入、离开。角色位移只能写在详细剧情的具体镜头中。
11. 如果本批次没有角色,不需要写人物位置,但仍然要写清楚场景的固定空间描述。
可参考的稳定参照物:
1. 室内:床、沙发、办公桌、讲台、投影幕布、门口、窗户、桌椅、走廊、屏风。
2. 室外:院门、石阶、街道、桥、车辆、路灯、树、栏杆、城墙。
3. 特殊空间:祭台、法阵、擂台、舞台、宴会主桌、宗门大殿、会议桌主位。
---
## 十三、连续性与画面状态规则
1. 同一场景中的人物位置、姿态、道具、服装、伤势、手中物品必须前后一致。
2. 如果前一批次写了角色移动到某处,下一批次的开场画面状态和初始空间关系必须以移动后的结果为准。
3. 如果前一批次写了角色坐着,下一批次不能直接写成站着,除非前一批次画面内容已经明确写了起身。
4. 如果剧本中某个道具已经明确为“黄铜钥匙”,后续不能擅自改成“紫檀木钥匙”“玉钥匙”等其他材质。
5. 如果某个道具在桌面、手中、地上发生了位置变化,下一批次必须根据前一批次的结尾画面结果更新。
6. 不得自行添加剧本中没有的新道具、新人物、新事件。
7. 每个批次必须写“开场画面状态”和“结尾画面状态”。开场画面状态用于锁定本批次第 0 秒已经存在的可见信息;结尾画面状态用于锁定本批次最后一秒应停留的画面结果。
8. 开场画面状态和结尾画面状态只写可见事实,包括人物位置、姿态、服装、手中物品、关键道具位置、伤势、环境变化和情绪状态。
9. 状态字段禁止写抽象承接说明、笼统开场说明或省略式表达。
10. 状态字段禁止写台词,禁止使用引号引用台词。若需要说明台词进度,只能用无引号的简短事实说明,例如本批次对白已结束。
---
## 十四、音效规则
1. 只生成音效,禁止生成音乐。
2. 禁止生成任何字幕、文字、水印。
3. 每个批次开头都必须写:
只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。
4. 音效只写环境声和动作声,例如脚步声、风声、雨声、门响、衣料摩擦声、喘息声、碎裂声、纸张燃烧声。
5. 如果某个镜头没有明确音效,直接省略“音效”字段。
6. 禁止写“音效:无”“无音效”“音效:无明显音效”。
7. 禁止写鼓点、配乐、BGM、旋律、氛围音乐、紧张音乐、悲伤音乐、史诗音乐等音乐类描述。只允许写环境声和动作声。
---
## 十五、标准输出格式
请严格按照以下格式输出:
---
【批次 1】
视觉风格:[填写视觉风格;若用户未填写,默认真人实拍短剧风格]
只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。
预计时长:[必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒。根据剧情密度判断;信息量足够时优先 12-15 秒,内容较短且无法自然合并时可低于 12 秒。禁止写时间范围,禁止为了凑满 15 秒拉长无台词镜头。]
开场画面状态:[只写本批次第 0 秒画面中已经存在的人物、位置、姿态、服装、手中物品、关键道具位置、伤势、环境和情绪状态。禁止写抽象承接说明或笼统开场说明。]
初始空间关系:[按“固定空间锚点 / 全部在场主要角色初始站位 / 初始距离关系 / 朝向与视线关系”写清楚。只写本批次第 0 秒的初始空间状态,不写后续位移或行动路径,不要只写画面左右,不要写“同上”。]
以下是详细剧情:
镜头 1:0-X秒,开场镜头,[景别],[运镜/固定镜头],[详细画面内容,包括人物动作、神态、构图、光影、节奏变化]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]
镜头 2:X-X秒,切镜,[景别,标注正反打/反应镜头/细节镜头/空镜],[运镜/固定镜头],[详细画面内容,必要时承接前一镜的动作变化]。角色名说/内心独白/画外音:“原台词”。
镜头 3:X-X秒,一镜到底,[景别变化],[运镜方式],[完整连续动作、走位、发现过程或情绪递进]。音效:[具体音效]
结尾画面状态:[只写本批次最后一秒应停留的画面结果。必须覆盖所有在场主要角色的位置、姿态、视线、情绪,以及关键道具位置和环境变化。不要写台词,不要使用引号。]
---
【批次 2】
视觉风格:[填写视觉风格;若用户未填写,默认真人实拍短剧风格]
只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。
预计时长:[必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒。根据剧情密度判断;信息量足够时优先 12-15 秒,内容较短且无法自然合并时可低于 12 秒。禁止写时间范围,禁止为了凑满 15 秒拉长无台词镜头。]
开场画面状态:[只写本批次第 0 秒画面中已经存在的人物、道具、姿态、伤势、情绪和空间位置。禁止写抽象承接说明。]
初始空间关系:[按“固定空间锚点 / 全部在场主要角色初始站位 / 初始距离关系 / 朝向与视线关系”完整写清楚。若与前一批次属于同一场景,也必须重新完整写清楚,并根据前一批次的结尾画面结果更新本批次的角色初始位置;最终输出只写第 0 秒的具体空间事实,不写后续位移或抽象承接语。]
以下是详细剧情:
镜头 1:0-X秒,开场镜头,[景别],[运镜/固定镜头],[详细画面内容]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]
镜头 2:X-X秒,切镜,[景别,标注正反打/反应镜头/细节镜头/空镜],[运镜/固定镜头],[详细画面内容]。角色名说/内心独白/画外音:“原台词”。
结尾画面状态:[只写本批次最后一秒应停留的画面结果。必须覆盖所有在场主要角色的位置、姿态、视线、情绪,以及关键道具位置和环境变化。不要写台词,不要使用引号。]
---
如果整个批次全段一镜到底,标准格式可简化为:
以下是详细剧情:
镜头 1:0-X秒,一镜到底,[景别变化],[运镜方式],[完整连续动作、走位、发现过程或情绪递进]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]
如果只是局部一镜到底,可以在同一批次中先写开场镜头或切镜,再把需要连续完成的段落写成“一镜到底”镜头。
---
## 十六、生成前自检
正式输出前,请在内部检查以下内容,但不要把自检过程输出给用户:
1. 是否一次只处理一集剧本。
2. 如果用户提供了场景图,是否已经先拆解图像元素、固定空间锚点、初始距离与朝向、关键道具位置。
3. 如果用户提供了场景图,是否已经先输出每场戏初始关系确认表,并等待用户确认。
4. 场次初始关系中是否写清空间锚点、角色站位、初始距离关系、中间阻隔、朝向与视线。
5. 每批次初始空间关系是否只写第 0 秒的初始关系,角色位移是否只写在详细剧情的对应镜头中。
6. 每个批次是否根据剧情密度判断时长,并且预计时长是否写成具体秒数,而不是时间范围。
7. 是否把 15 秒当成上限,而不是必须填满的容器。
8. 低于 10 秒的批次是否有必要理由,或是否属于台词少但必须独立成段的短事件。
9. 是否把镜头切分误当成批次切分,导致批次过碎。
10. 是否把一句台词、一个表情反应、一次停顿或一个空镜机械拆成独立批次。
11. 是否为了凑满 15 秒,拉长心理、表情、眼神、语气停顿、空镜、道具细节、环境镜头或无台词反应。
12. 无台词镜头是否短、准、有效;普通反应、眼神、表情、手部动作、道具细节、空镜和环境镜头是否通常控制在 0.8-3 秒。
13. 只有重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果,是否才把无台词镜头延长到 4-6 秒。
14. 每句台词是否先判断了节奏类型:急促压迫型、正常推进型、阴阳怪气 / 试探 / 冷嘲型、情绪压抑 / 哽咽 / 崩溃型、信息揭露 / 解释型长台词。
15. 每句台词的节奏判断是否只用于估算语速、停顿、镜头承载和批次总时长,而不是作为拆批次依据。
16. 台词语速是否符合剧情情绪;紧张冲突是否允许更快语速,阴阳怪气、试探、哽咽、迟疑是否保留足够停顿和反应。
17. 台词时长是否根据“节奏类型 + 字数 + 停顿 + 动作”综合判断,而不是只按固定每字秒数机械计算。
18. 中等台词 13-25 个汉字是否根据节奏给足 3-8 秒,或拆成说话镜头 + 反应镜头。
19. 长台词 26-45 个汉字是否至少拆成 2 个镜头承接。
20. 超长台词 45 个汉字以上是否拆成 3 个以上镜头承接,必要时才跨批次。
21. 超过 30 个汉字的台词是否拆成说话镜头 + 反应镜头 / 正反打镜头 / 细节镜头,并用画外音承接;是否避免用一个镜头硬拍完。
22. 是否出现二十多个汉字只给 3 秒、三十多个汉字只给 5 秒,或把阴阳怪气、哽咽迟疑按急促争吵处理这类明显不合理安排。
23. 台词是否一字不差保留,是否没有删减、改写或新增。
24. 如果台词跨批次,是否按原文标点或完整语义节点拆分,避免只剩半句。
25. 是否新增了剧本中没有的台词、人物、道具或事件。
26. 每个镜头的时间后是否都明确标注“开场镜头 / 切镜 / 一镜到底”。
27. 从镜头 2 起,如果是从上一镜切换到当前画面,是否标注“切镜”。
28. 一镜到底段落是否确实需要连续动作、走位、发现过程或情绪递进;如果只是局部一镜到底,是否允许它和切镜共同存在于同一批次。
29. 每个批次是否都写了完整初始空间关系。
30. 初始空间关系是否覆盖所有在场主要角色;即使某个角色没有台词或动作,只要仍在场,是否写出了他的位置和状态。
31. 初始空间关系中是否误写了随后、准备、将要、走向、起身、退后、逼近、离开等后续动作。
32. 是否出现“同上”“同前”“场景不变”等禁用表达。
33. 开场画面状态是否写成具体可见事实,而不是抽象承接说明或笼统开场说明。
34. 结尾画面状态是否只写最后一秒的可见结果,是否覆盖所有在场主要角色和关键道具位置,且没有台词、引号或新增对白。
35. 是否误写音乐、字幕、文字、水印,是否出现鼓点、配乐、BGM、旋律、氛围音乐等音乐类描述。
36. 时间轴是否连续,是否从 0 秒开始并到达预计时长。
37. 每个镜头是否像视频提示词,而不是剧情概述。
---
可选输入格式如下。用户可以按此格式一次性提供信息;如果用户没有按此格式填写,你需要主动识别信息是否完整,并按“使用方式”中的规则提问或执行。
视觉风格:
(可直接填写想要的风格。以下仅为示例:真人实拍短剧风格 / 真人实拍写实风格 / 电影感写实风格 / 古装仙侠剧视觉风格 / 都市短剧视觉风格 / 2D 日漫风格 / 3D 动漫风格。若不填写,默认真人实拍短剧风格。)
处理方式:
(可填写:自动处理 / 先确认场景关系 / 先确认批次拆分 / 直接生成。若不填写,默认自动处理。)
场景图/空间参考图:
(可上传或说明对应关系,例如:图 1 对应场景 1,图 2 对应场景 2。若未上传场景图,则按剧本文字默认处理。)
剧本/分镜脚本内容:
(建议一次只粘贴一集剧本。请在这里粘贴单集剧本、分镜脚本或台词文本。)
实际使用的时候,只需要把上述提示词发送给任意的AI大语言模型工具,之后根据指令复制/上传剧本即可。

上传或复制剧本,不赶时间的话,处理方式建议选择“自动处理”,此时如果你的场景图已经生成好了,可以说“我有场景图”。
可以看到,我这一集剧本涉及到4场戏,因此包含四个场景,在我上传了一共6张图(有的场景包含不止一张图)后,它对场景的核心信息进行了提取,并且还有一些与剧本中对不上的场景信息需要与我们确定。

之后会与你确认将剧本拆分为若干批次,也就是Seedance2.0每批次执行的提示词内容以及对应的原文范围。要是你觉得满意,便可继续推进;要是你认为时长过长或过短,或是想重新分配,都能向其反馈。

注意:
此版本的提示词倾向于将剧本拆得比较细,对各种心理、神态、动作的刻画相对比较深刻,但这样会增加单集的总批次数。如果你希望稍微节省一点,在这个阶段就要跟他确认好。你可以对照着原文的范围自己估计一下,看每个批次能否增加更多的内容。
如果你觉得哪里有问题,可以跟它说,例如使用以下类似的话术:
- “批次 1,我希望能够呈现原文从哪一句话到哪一句话的内容。”
- “批次 X,我希望将更多的台词放进来,减少总批次数。”
- “帮我把总批次所花的时间压缩到两分半以内。”
确认好后,就会给你把剧本拆分成对应的若干批次的视频分镜提示词了。结合前面说的起手式+视频分镜提示词的模式,我们就能跑视频了。 可以看到,由于它前面读取了你的场景图,里面角色的位置关系与你的图能够对应得很好。再加上提示词里画面的初始状态和结尾状态,与后面每个批次都能首尾衔接得上,角色位置关系的演变也比较合理。

在将剧本拆成视频分镜提示词后,脑子里一定要有一个清晰的角色的行动路径。
视频分镜提示词中的开场状态-结束状态可以很好地明确角色的初始和结束的位置。但能否达成这样的效果,怎样达到效果,我们要如何人为地进行优化,是需要动脑筋的。


课堂上会拿案例进行详细讲解演示
5)固定音色
将生成的视频导入到剪映中,找到对应角色说话的区域,快捷键I为设置起始位置,O为设置终点位置。
将不同角色说话的片段选中,建议不超过5秒钟。
随后导出音频作为角色的音色资产。之后用seedance 2.0生成视频就可以反复调用对应角色的声音资产作为音频参考了。





Libtv现在支持分离人声,并裁剪声音,这样方便直接在Libtv画布当中固定音色。建议每次截取的声音不要超过5秒。



6)素材衔接技巧
短剧是由多个片段拼成的,如果每次生成的素材光影、站位差异太大,后期就很难接上。
##### (1)A. 抽帧接力
将上一个视频生成的最后一帧截图,作为下一个视频生成的首帧参考图上传。这样能最大程度保证两个镜头的机位、光线和人物姿态在剪辑时能够无缝衔接。
如果是在libtv里生成的视频素材,鼠标悬停在视频上,右下角有个相机图标,可以截取首帧或者尾帧。


也可以把视频素材下载下来,导入到剪映或其他任意剪辑软件中:

再继续做下一段素材的提示词的时候,写上:@图片X作为首帧


这样生成的结果就能够收尾相接了。
jimeng-2026-02-13-7150- 作为首帧。 是阿泷。是羊羊。是西堂。只生成音效,不生成音乐。不要生成任何字幕。....mp4下载 ↗##### (2)B. 延长视频
还可以上传上一个片段,接着在提示词中要求模型延长视频。如此,模型便能直接参照上一段视频的尾帧,同时还能借鉴上一段视频所使用的声音,这样就不需要像前面那样事先提取声音作为音色参考了。
鉴于目前平台针对真实人脸的限制,这种方法在即梦或者其他平台已几乎无法继续使用。但在libtv中,依旧只需要按照上节课介绍的方法,将需要延长的视频素材,进行seedance 2.0合规校验,通过审查后即可完成后续的操作。


只需要在提示词开头写上:将@视频延长XX秒。
但实测下来,抽卡率有点高,效果没有提取上一段视频的尾帧那样稳,音色的还原也比较一般。

直接延长视频和抽帧接力,在实际剪辑的时候,对剪辑能力其实是有一定要求的。
因为即便你是用上一段视频的尾帧去作为下一段视频的首帧,视频在重新生成的过程中,画面还是会发生一些变化。比如人物比例、背景细节、色调、光线,都有可能和前一段不完全一致。所以很多时候你会发现,它理论上是接上了,但实际看起来还是会有一点卡顿感,或者有一些不自然的变化。
所以这里我不建议大家盲目去用这种方式硬接。
尤其是在短剧制作里,我们大多数时候还是要回到镜头剪辑本身。镜头和镜头之间,不一定非要靠首尾帧或者延长视频去强行连起来。很多时候,只要你掌握了镜头组接的基本原则,直接切镜头反而会更自然、更干净。
比如景别要有变化,动作要能接上,视线方向要合理,人物空间关系不能乱,剪辑点要干净。这些原则掌握之后,即便不用前面讲到的那些方法,你也可以很好地控制镜头之间的衔接。
短剧本身就是一个非常依赖剪辑节奏的内容形式,不要总想着把镜头硬连成长镜头。该切的时候就切,只要切得合理,观众是不会觉得突兀的。
关于镜头组接的这些基本原则,后面的视听语言直播课里,老师会给大家详细讲。
7)即梦等平台真人审核限制
如果使用libtv的seedance 2.0模型创作的小伙伴,下面这部分内容可以不看了。
对于使用即梦等其他平台的seedance 2.0模型的小伙伴来说,在上传参考图时,目前即梦平台针对真人照片和面孔会设置限制,拦截极度写实的真人照片或明星面孔。如果你的剧本就是想用某个特定真人的长相特征,直接上传原图大概率会面临生成失败或违规提示。

但制作AI仿真人短剧又绝对绕不开真人写实风格的角色资产的。下面教大家几个提高成功率的方法。
##### (1)a. 局部面部转绘 (脸部轮廓可能改变)
利用即梦/香蕉等图片模型,对图片的面部进行重绘。


这样能在保留人物骨相和核心特征的同时,让脸部恰好低于系统对“绝对真实照片”的判定阈值。此方法成功率近乎百分之百,并且仅对脸部进行重绘,衣服细节仍能保持较高的还原度。不过,其不足之处在于,生成视频素材时,脸部相似度会稍有降低。
##### (2)b. 平台站内洗图 (需要多次尝试)
这是一个非常实用且巧妙的过审技巧,核心逻辑是让平台信任自家产出的数据。
将你准备好的高写实人物三视图,先上传到即梦的图像生成模块中进行一次轻微的修改,或者直接通过提示词让即梦在图片的角落生成一行字:“此人物由AI生成”。
修改完成后,直接在即梦工作台里将这张图拖入视频生成模块中引用。这一步必须在即梦平台内部完成! 平台系统有概率会将其识别为自家 AI 生成的合法原生资产。千万不要耍小聪明在本地用 PS 加上这句话再上传,这种是无效的。

这种方法的优势在于,角色脸部能得到更好的还原,但仍存在生成失败的可能性。一次生成四张图后,依次将它们拖入下方的视频生成模块作为参考图,逐一尝试,通常会有一张可用。
比如前面图生视频的时候我们选取的那个男主和女主对坐的场景图作为案例,在右上角添加文字后,实测只有第三张图能绕过审查。


一旦成功绕过审查,就生成结果而言,Seedance 2.0 的全能参考模式明显优于单纯的图生视频模式。无论是男女主角脸部的近景还是特写,都与角色资产图的还原度极高。
seedance全能参考.mp4下载 ↗##### (3)c. 脸部加网格 (脸部网格需要多次抽卡)
对于四视图的角色图(特写+三视),主要限制人脸的就是左边的特写,要么不出四视图,只出三视图,不要左边的特写了,基本都能成功,但这样生成的视频一旦切到人物的近景就容易变成即梦脸。
为了解决这个问题,只需要将左边的脸部特写处理一下,增加一个网格,这样既能保证基本的脸部轮廓,又能做一些遮挡处理,成功率百分之70左右。最好用Nano Banana 2来改图(使用方法见第四课的手册),即梦改图脸会变,提示词如下:
香蕉多出几张图,多次尝试,有时候脸上的网格如果太稀疏了,容易失败。

##### (4)d. 脸部特写遮挡 (效果不错)
基本如果只有三视图(不包含脸部特写)是基本不会触发平台的人脸审核限制的。问题的关键就在四视图里的脸部特写。但如果不放脸部特写,只保留三视图,做视频的时候一旦切近景,很可能就会变成“即梦脸”。
于是我们可以在PS或者其他作图工具中,按照如下所示,画一个小方框遮住脸部的一侧区域,这样基本就能通过审核了。跑视频的时候,由于只遮住了一小半区域,AI是能通过另一半脸脑补出完整脸部长相的。

##### (5)e. 多角色生成失败
对于多角色的视频素材,不要一上来就像下面这样把几个角色全部参考,然后去跑15秒的视频。

一定要一个角色一个角色地利用如上的两种方法去尝试,让角色分别去跑4秒钟的视频,要确保每个角色图都能通过审核之后,再去将多角色合到一起来生成长素材。
##### (6)f. 文本脱敏
很多时候图片没问题,但提示词自投罗网了。各大平台不仅有图像审核,还有极度敏感的文本审核词库。
即使你的参考图过了审核,在写视频动态提示词时,也绝对不要出现任何真实明星或公众人物的名字。如果你想生成神似某个明星的动态,请将人名替换为客观的骨相与气质描写(例如:将某女星替换为“清冷骨相、驼峰鼻的东方古典美女”)。用外貌特征描写代替具象的专有名词,就能完美规避文本层的拦截。
5、可灵视频 3.0 Omni 的使用技巧 (选择性学习)
可灵视频 3.0 Omni (kling o3)模型同样是一个非常适合制作AI仿真人短剧的模型。支持音画同步、自定义分镜,支持上传/录制视频主体,支持对主体添加音色,同样最长支持15秒的素材生成。
⚠️注:建议大家优先选用Seedance 2.0模型。就短剧制作而言,该模型目前的效果远超其他模型。若同学们在掌握此模型后还有精力,可看看下面的内容。
下面教大家在可灵官网使用该模型的方法:(libtv中该模型名为kling o3,使用方法类似,在此不展开)

在Omni创作区域,有图片/主体参考、图生视频、指令变换、视频参考四个选项卡。
其中主体参考是用得最多的。图生视频则与在可灵的视频生成模块里使用可灵视频 3.0 模型的使用差别不大,只不过可以更加灵活地@主体。指令变换相当于视频编辑功能。视频参考则是可以参考视频内容/运镜,延续视频或者生成全新的画面。

1)可灵主体库
只需上传/拍摄一段 3-8s 的角色类视频,模型即可提取核心角色特征与原声音色,完美还原角色的样貌、身形、神韵。



一旦创建好主体后,在Omni的提示词输入界面,只需要输入“@”,即可调用包含设定好音色的角色。


2)智能分镜
在提示词写法方面,可灵与之前的 Seedance 2.0 差别不大。然而在实际应用中,可灵生成效果在很大程度上依赖创作者的经验。简单来讲,它不像 Seedance 2.0 那样上手容易。
使用 Seedance 2.0 时,或许直接把剧本当作提示词一股脑丢给模型,即便不依照前面提到的输入结构化分镜提示词,也能产生相当不错的效果。但可灵视频 3.0 omini 模型就没那么智能,指令越清晰明确,生成效果才会越好。
我们正常地调用提前创建好的角色和场景主体,按照两种提示词的写法来分别做出尝试:
直接输入剧本:

开启自定义分镜,输入结构化分镜提示词:

直接输入剧本 开启自定义分镜
大家看出区别了没?
要是不开启“自定义分镜”,仅仅在提示词输入界面输入剧本,即便已经开启 “智能分镜” 选项,依然有可能出现完全不切镜的状况。要是直接生成 15 秒的长镜头,画面不出现问题才奇怪呢。
所以,对于时长只有几秒钟的素材,大家可以直接用简洁的语言输入,或者采用标准提示词格式进行输入。但对于十几秒的较长素材,就一定要开启“自定义分镜”功能。
自定义分镜可以进行镜头级别的精确掌控,明确指定每个镜头的时长、景别、视角、叙事内容以及运镜方式等等,完成镜头之间的起承转合。一次生成,即可完成节奏分明、结构完整的多镜头叙事。
具体的操作步骤如下:
在图片/主体参考模式下,选择 视频3.0 Omni模型,勾选智能分镜,点击自定义分镜。

按照前面教大家的,将剧本拆成包含时长、景别、运镜、画面内容的结构化分镜提示词,然后一条一条地复制进来,在每一条提示词中都@主体库,调用里面的角色、场景、道具等。

从理论上来说,对于角色与场景并不复杂,特别是角色数量在两个以内的情况,这样时长 15 秒的长素材效果还算可以。
但要是角色数量达到三个以上,且处于复杂的室内环境,台词又较长,那么生成效果就会明显变差。就像上述所举的例子,无论是场景、角色,还是台词、人物站位都不简单,最终呈现的效果都比较普通。
所以,建议大家如果想要生成较长的素材,尽量不要使用可灵视频 3.0 omni,而是多选用 seedance 2.0。可以把可灵视频 3.0 omni 当作 seedance 2.0 使用过程中的补充,用它来生成 10 秒以内、没那么复杂的镜头,效果会十分稳定。当Seedance 2.0 模型排队时间较长的时候,可以借助可灵、Vidu等生成一段段短素材再去拼接,也能拼成不错的作品。
3)其他玩法
##### (1)a. 指令变化
可以利用多模态文本 / 图片 /主体的输入信息,结合来驱动视频 3.0 omni 模型,轻松对原视频进行与主体与背景的增加、修改、删除,也可以修改视频的风格、天气、颜色、材质、景别视角等。
视频原片
修改素材.mp4下载 ↗视频增加内容


视频删除内容

视频改背景


视频换视角/景别

视频换风格

##### (2)b. 视频参考
可以上传3-10s 视频作为参考,配合文字、图片、或者主体等指令,生成下一个分镜头;或者参考视频内的动作/运镜,生成全新的视频画面。
生成下一个镜头

六)Seedance 2.0 原生字幕消除
使用Seedance 2.0制作竖屏短剧时,常常会不受控制地生成大量原生字幕。这些字幕往往带有诸多乱码,而且每段字幕的格式也不尽相同。此类字幕必须去除,因为甲方肯定不会接受,需将其去除后,在后期利用剪辑软件自行添加字幕。

推荐用剪映里的AI消除功能,选择智能选取,找到素材里字幕最长的那一帧,涂抹一下,会自动识别字幕,随后点消除即可。这种方式需要消耗剪映会员的积分,但是方便,可以直接在剪辑软件里操作,不用来回折腾,而且效果较好。


Libtv智能去字幕

可以选择智能擦除或者框选擦除两种模式。
智能擦除就是让AI自动识别字幕,并一键去除。

在框选擦除模式中,挑选字幕最长的那一行,手动框选字幕所在区域。随后,AI会对该区域进行整体擦除。

七)第三次作业:视频镜头生成(无需提交)
具体内容:
- 动态转化: 利用上节课生成的角色、场景、道具等资产图,使用即梦(Seedance 2.0)或者其他视频模型,将自己剧本中的内容生成连贯的视频素材。
- 质量筛选:对于Seedance 2.0 生成的15秒长视频素材,学会甄别和筛选。下节课将教大家如何处理和优化有瑕疵的镜头。
下一步可以读