Seedance入门完整文章

用 Seedance 2.0 控制视频镜头

通过完整课程理解视频生成、镜头控制与可用素材的筛选。

本篇目录
  1. 一)工作流概述
  2. 二)主流视频模型简介
  3. 1、聚合平台 —— LibTV(首推)
  4. 2、各视频模型平台官网
  5. 1)即梦 (Seedance 2.0):上限极高的“一键成片”神器
  6. 2)可灵:画质与稳定性并存的“六边形战士”
  7. 3)Vidu:老牌参考生视频的神器
  8. 三)文生视频
  9. 1、基本概述
  10. 2、文生视频实操
  11. 3、Seedance 2.0 相关案例展示
  12. 四)图生视频
  13. 1、基本概述
  14. 2、图生视频实操
  15. 1)操作界面
  16. 2)图生视频提示词技巧
  17. 3)最新图生视频模型的玩法
  18. 3、首尾帧生视频
  19. 1)首尾帧的功能和作用
  20. 2)首尾帧图片要点
  21. 3)首尾帧提示词写作要点
  22. 4)如何确保首尾帧的连贯性
  23. 5) 首尾帧在短剧中的应用
  24. 五)🌟五)参考生视频
  25. 1、基本概述
  26. 2、参考生视频的优势
  27. 3、参考生视频的提示词写法
  28. 4、Seedance 2.0全能参考的使用技巧
  29. 1)基本操作
  30. 2)简短画面:自然语言描述提示词
  31. 3)连贯剧情片段:资产+原生剧本
  32. 4)复杂调度片段:资产+视频分镜提示词🌟
  33. 5)固定音色
  34. 6)素材衔接技巧
  35. 7)即梦等平台真人审核限制
  36. 5、可灵视频 3.0 Omni 的使用技巧 (选择性学习)
  37. 1)可灵主体库
  38. 2)智能分镜
  39. 3)其他玩法
  40. 六)Seedance 2.0 原生字幕消除
  41. 七)第三次作业:视频镜头生成(无需提交)

一)工作流概述

在前两节课中我们提到,以往 AI 视频的工作流程一般为 “文 - 图 - 视 - 音 - 剪”,各个环节相对独立。除了撰写剧本、拆分镜头这些 “文” 的部分,光是生成分镜图就常常要耗费大量时间。每一张图都可能需要多次尝试(也就是我们常说的 “抽卡”)以及精心修改,这也就是所谓的 “手搓”。相对而言,后续 “视” 这个环节,也就是把静态分镜图转化为动态分镜视频,操作起来反而没那么复杂。

随着 Vidu、可灵等厂商推出的参考生视频模型日益好用,分镜图的重要性逐渐降低。对于很多质量要求没那么高的作品来说,甚至无需提前生成分镜图,仅设置好几张角色、场景、道具资产,就能生成全部视频素材。特别是随着 Sora 2 (官方已关停)和 Seedance 2.0 的问世,以及还未公测的快乐马(HappyHorse),这种工作流程变得越发常见。可以说从“文 - 图 - 视 - 音 - 剪”变成了“文 - 资 - 音 - 剪”。

所以,本期的 AI 仿真人短剧训练营课程,我们将视频模型的实操课程提前,目的是教会大家充分挖掘当下最实用视频模型的潜力,让大家能够快速制作出一集完整且合格,甚至称得上优秀的AI仿真人短剧。而关于分镜出图的技巧,我们会作为一种实现精细化控制的方法,放在下一节课讲解。

二)主流视频模型简介

当前,在国内外 AI 视频生成领域,无论是闭源模型还是开源模型,都呈现出百花齐放的繁荣态势,工具的更新迭代更是接连不断。

开源模型如 LTX-2.3、Wan 2.2 等,闭源模型像 Seedance 2.0、Veo 3.1、Wan 2.7、可灵 3.0、Vidu Q3、PixVerse V6、Hailuo 2.3 等,它们各有各的优势。

谈及使用这些模型的平台,主要有以下两种类型:

其一,在各模型官网通过充值会员来使用,像即梦、可灵、Vidu、拍我等都属此类。然而,要是你想体验不同厂家的模型,就需要开通众多会员,操作起来颇为不便。

其二,在各类聚合平台上使用,例如LibTV、Tapnow、lovart等。这类平台通常接入了常用的主流视频模型,你只需在一个平台充值,便能调用多家模型,使用更为便捷。因此,我们更建议大家采用这种方式。

至于开源模型,虽然可以进行本地部署,但这对技术水平以及电脑配置的要求相当高,所以在此暂不做详细介绍。

由于工具众多,无法一一详细介绍。针对当下 AI 仿真人短剧,我们从综合生成效果以及使用门槛这两个维度出发,后面着重为大家介绍即梦 AI 的 Seedance 2.0 模型。

1、聚合平台 —— LibTV(首推)

双击画布,就能创建视频节点。在此处的模型选择栏中,大家可以看到众多视频模型。我们将各家视频模型的信息罗列如下,感兴趣的同学在学习时不妨都去尝试一下,感受不同模型生成效果的差异。要是模型众多,让你感到眼花缭乱,那么重点关注Seedance系列(字节出品)和kling系列(快手旗下可灵出品)即可。

图片展示的是LibTV平台中添加节点的界面。界面背景为深色,左侧有“添加节点”标题,下方有多个选项,包括文本、图片、视频、视频合成(Beta)、音频、脚本(Beta),以及添加资源的上传和从图库选择。其中“视频”选项被高亮显示,其下方说明为“创意广告、动画、电影”。该图片与上下文紧密相关,上下文提到在LibTV平台双击画布可创建视频节点,并在模型选择栏中看到众多视频模型,此图直观呈现了添加视频节点的操作界面及视频选项。
图片展示的是LibTV平台中添加节点的界面。界面背景为深色,左侧有“添加节点”标题,下方有多个选项,包括文本、图片、视频、视频合成(Beta)、音频、脚本(Beta),以及添加资源的上传和从图库选择。其中“视频”选项被高亮显示,其下方说明为“创意广告、动画、电影”。该图片与上下文紧密相关,上下文提到在LibTV平台双击画布可创建视频节点,并在模型选择栏中看到众多视频模型,此图直观呈现了添加视频节点的操作界面及视频选项。
图片展示了LibTV平台中视频节点的模型选择栏。画面中列出了多个视频模型,包括Seedance 2.0 VIP、Seedance 2.0 Fast VIP、Kling O3、Kling 3.0、Wan 2.7、Kling O1、Shot V2等。其中,Seedance 2.0 VIP和Seedance 2.0 Fast VIP被标记为VIP模型,且前者为最强视频模型,会员专属通道,15s音画同步。此图与上下文紧密相关,上下文提到在LibTV平台双击画布创建视频节点,模型选择栏中能看到众多视频模型,重点介绍了Seedance系列和kling系列模型。
图片展示了LibTV平台中视频节点的模型选择栏。画面中列出了多个视频模型,包括Seedance 2.0 VIP、Seedance 2.0 Fast VIP、Kling O3、Kling 3.0、Wan 2.7、Kling O1、Shot V2等。其中,Seedance 2.0 VIP和Seedance 2.0 Fast VIP被标记为VIP模型,且前者为最强视频模型,会员专属通道,15s音画同步。此图与上下文紧密相关,上下文提到在LibTV平台双击画布创建视频节点,模型选择栏中能看到众多视频模型,重点介绍了Seedance系列和kling系列模型。

2、各视频模型平台官网

1)即梦 (Seedance 2.0):上限极高的“一键成片”神器

  • 核心优势: Seedance 2.0 可以说是目前具备最强“一键成片”能力的模型。它的提示词门槛极低,只需简单的白话描述,就能生成极其惊艳的影视级运镜、拍摄和剪辑效果。得益于其庞大的训练素材库,它能对各种复杂的视频主题需求给出非常出色的反馈。配合即梦自家优秀的Seedream 图像模型,理论上完全可以在即梦平台内全流程闭环做出一整部高质量的影视级片子。
  • 局限与痛点:若不使用VIP模式,算力压力大,高峰期排队时间极其漫长,但VIP模式价格较贵。模型状态极不稳定: 表现好的时候,视觉效果和动态张力能无情碾压市面上所有视频模型;但一旦智商“下线”,表现甚至还不如早期的可灵。平台底层的安全协议对“真人写实风格”的影片制作限制极其严格,很容易触发肖像或动作审核拦截。

2)可灵:画质与稳定性并存的“六边形战士”

  • 核心优势: 在生视频的综合效果方面非常扎实。在即梦推出 Seedance 2.0 之前,可灵可以说是闭源模型中的绝对首选。它拥有极其清晰、稳定的画质,极度擅长真人写实和厚重电影感的影片制作。目前最新的视频 3.0 / 3.0 Omni 模型在“自定义分镜”上发挥极其稳定,支持绑定角色的人物主体库和人物音色。配合强大的音画同出和多图融合参考功能,能获得极具质感的影视级表现。如果你不想承受 Seedance 的漫长排队和偶尔的降智,可灵绝对是最靠谱的替代方案。最新更新,3.0模型已支持原生4k分辨率视频。
  • 局限与痛点: 对于难度极大的大动态动作或极限运镜,表现较为一般。它不像 Seedance 那么无脑听话,非常考验创作者自身的视听语言拆解能力和提示词精准度。人物台词的精准度时好时坏,10秒以上的长素材抽卡率较高。最新的视频 3.0 和 3.0 Omni 模型较为昂贵,试错成本较高。

3)Vidu:老牌参考生视频的神器

  • 核心优势: Vidu 曾经是制作 AI 漫剧和动漫神级动作戏的“神”,它非常擅长处理大幅度的打斗动作和运镜。在 Seedance 2.0 问世之前,Vidu在一众参考生视频工具中绝对是佼佼者。视频的生成速度极快。目前,最新的 Vidu Q3 也已经全面支持了音画同出和智能切分镜功能,同样能够产出动作流畅、张力十足的影视级效果。
  • 局限与痛点: 同样对于10多秒的长素材来说,崩坏率有点高。虽然 Q3 之前的旧模型价格比较友好,但最新 Q3 模型的价格已经大幅上涨,基本与可灵 3.0 齐平。

尽管这些 AI 视频工具品类丰富、功能多样,但它们的核心功能实则相通。接下来,我们将围绕最基础的文生视频、图生视频以及参考生视频这三项功能,为大家呈现这三款工具各自的使用技巧。

三)文生视频

1、基本概述

文生视频(Text-to-Video),顾名思义,就是直接通过输入自然语言提示词,让 AI 大模型从零开始生成一段动态视频。它的核心原理依赖于底层模型对语言语义的深度理解,以及对物理世界动态规律的模拟计算。

文生视频最大的特点在于能够充分发挥 AI 模型的想象能力与原生动态表现力。由于没有初始参考图的结构限制,模型在生成运镜轨迹、物理交互(如水流、烟雾、爆炸)时,往往能展现出最极致的丝滑度与连贯性,甚至经常能带来意想不到的视觉奇观。但它的短板同样明显:由于完全依赖文字描述,它的“可控性”较差,很难精准锁定某一个特定的画面构图或人物长相,且在某些特定模型下,直接文生的初始分辨率和画面细节质感可能略逊于精修后的图生视频。

文生视频非常适用于想要批量、快速成片,制作十几秒情绪短视频,进行轻量级剪辑甚至一镜到底不剪辑的场景。它也常常被用作影片中的“空镜头”或与前后人物长相联系不大的素材片段(例如:远景的城市车流、天空的云卷云舒、抽象的情绪空镜)。

以往的文生视频由于时间短、物理规律崩坏较多,常被认为比较鸡肋。但自从 Sora 2 和 Seedance 2.0 问世后,模型对物理规律的理解和超长时序的连贯性有了质的飞跃,诞生出了非常多实用的玩法。无论是快速制作各种具有视觉冲击力的商业广告、文旅宣传片、自然科普视频,还是天马行空的科幻创意短片,当下的文生视频模型都不在话下。

2、文生视频实操

LibTV操作界面

双击画布后,创建视频节点,在不上传任何图的基础上,就只能使用文生视频的模式。

图片展示的是LibTV操作界面中添加节点的弹窗。弹窗内有多个选项,其中“视频”选项被高亮显示,其下方说明为“创意广告、动画、电影”。该图片与上下文紧密相关,上下文提到在不上传任何图的基础上,双击画布后创建视频节点,就只能使用文生视频的模式,而此图片直观呈现了在LibTV操作界面中添加视频节点的操作选项,帮助用户了解如何在该界面进行视频节点添加操作。
图片展示的是LibTV操作界面中添加节点的弹窗。弹窗内有多个选项,其中“视频”选项被高亮显示,其下方说明为“创意广告、动画、电影”。该图片与上下文紧密相关,上下文提到在不上传任何图的基础上,双击画布后创建视频节点,就只能使用文生视频的模式,而此图片直观呈现了在LibTV操作界面中添加视频节点的操作选项,帮助用户了解如何在该界面进行视频节点添加操作。
这张图片是LibTV的文生视频操作界面,界面左侧的“文生视频”选项被蓝色框标注,界面底部的“模型”区域显示选中的是“lvl Seedance 2.0 VIP”,界面中部蓝色框还标注了“提示词”输入栏,其中输入了对应文生视频的提示内容,为“缓慢推镜头,近景,仰拍。古代大户人家的院落中的正房,精致的飞檐翘角。细雨绵绵飘落,屋檐下的红灯笼在微风中轻轻摇曳。阴郁、肃穆,电影级光影。”,该界面对应的操作背景是文档中提及的LibTV双击画布创建视频节点后,不上传任何图即可使用文生视频模式的内容。
这张图片是LibTV的文生视频操作界面,界面左侧的“文生视频”选项被蓝色框标注,界面底部的“模型”区域显示选中的是“lvl Seedance 2.0 VIP”,界面中部蓝色框还标注了“提示词”输入栏,其中输入了对应文生视频的提示内容,为“缓慢推镜头,近景,仰拍。古代大户人家的院落中的正房,精致的飞檐翘角。细雨绵绵飘落,屋檐下的红灯笼在微风中轻轻摇曳。阴郁、肃穆,电影级光影。”,该界面对应的操作背景是文档中提及的LibTV双击画布创建视频节点后,不上传任何图即可使用文生视频模式的内容。

可灵操作界面

在左边栏中选择“生成”,在视频生成中,选择任意一个模型,各版本模型的优势也写得很清楚。不上传图片就相当于文生视频,上传了图片就相当于图生视频。

图片展示了即梦视频生成界面。左侧有“生成”“创意圈”“资产”等选项,其中“生成”被红色框突出显示。右侧是视频生成功能,有视频3.0、视频2.6等不同版本,视频3.0版本被红色框突出显示。上方有“视频生成”“动作控制”“数字人”选项卡,其中“视频生成”被红色框突出显示。该图片与上下文介绍的即梦视频生成操作相关,直观呈现了视频生成界面及版本选择情况。
图片展示了即梦视频生成界面。左侧有“生成”“创意圈”“资产”等选项,其中“生成”被红色框突出显示。右侧是视频生成功能,有视频3.0、视频2.6等不同版本,视频3.0版本被红色框突出显示。上方有“视频生成”“动作控制”“数字人”选项卡,其中“视频生成”被红色框突出显示。该图片与上下文介绍的即梦视频生成操作相关,直观呈现了视频生成界面及版本选择情况。
图片展示了即梦视频生成界面。左侧有“视频生成”“动作控制”“数字人”选项,当前选中“视频生成”。下方有“添加首尾帧图”“历史创作”按钮,提示词区域显示“缓慢推镜头、近景、仰拍。古代大户人家的院落中的正房,精致的飞檐翘角、雕梁画栋、屋檐下的红灯笼在微风中轻轻摇曳。静谧、肃穆、电影级光影”等内容,下方有“智能分镜”“自定义分镜”按钮。右侧为“词库&预设”区域,有“基础镜头”“运镜速度”“景别”等选项,其中“推进”“近景”被选中。该图与上下文介绍的即梦视频生成操作相关,展示了操作界面及部分设置选项。
图片展示了即梦视频生成界面。左侧有“视频生成”“动作控制”“数字人”选项,当前选中“视频生成”。下方有“添加首尾帧图”“历史创作”按钮,提示词区域显示“缓慢推镜头、近景、仰拍。古代大户人家的院落中的正房,精致的飞檐翘角、雕梁画栋、屋檐下的红灯笼在微风中轻轻摇曳。静谧、肃穆、电影级光影”等内容,下方有“智能分镜”“自定义分镜”按钮。右侧为“词库&预设”区域,有“基础镜头”“运镜速度”“景别”等选项,其中“推进”“近景”被选中。该图与上下文介绍的即梦视频生成操作相关,展示了操作界面及部分设置选项。

即梦操作界面

即梦的界面同样如此,当我们选择任意模型后,比如seedance 2.0,只需要把模型旁边的功能切成“首尾帧”,然后不上传图片,只输入提示词,则相当于文生视频;如果上传任意首帧或尾帧图,都相当于图生视频。

图片展示的是即梦视频生成界面。上方提示词为“缓慢推镜头,近景,仰拍,古代大户人家的院落中的正房,精致的飞檐翘角,细雨绵绵飘落,屋檐下的红灯笼在微风中轻轻摇曳。阴郁、肃穆,电影级光影。”下方有视频生成、图片生成等功能选项,其中视频生成处有“Seedance 2.0”和“首尾帧”选项被红色框突出显示。该图片与上下文介绍即梦操作界面,选择任意模型后,如Seedance 2.0,不上传图片只输入提示词即为文生视频,上传首帧或尾帧图则为图生视频的内容相关。
图片展示的是即梦视频生成界面。上方提示词为“缓慢推镜头,近景,仰拍,古代大户人家的院落中的正房,精致的飞檐翘角,细雨绵绵飘落,屋檐下的红灯笼在微风中轻轻摇曳。阴郁、肃穆,电影级光影。”下方有视频生成、图片生成等功能选项,其中视频生成处有“Seedance 2.0”和“首尾帧”选项被红色框突出显示。该图片与上下文介绍即梦操作界面,选择任意模型后,如Seedance 2.0,不上传图片只输入提示词即为文生视频,上传首帧或尾帧图则为图生视频的内容相关。

基本文生视频提示词公式:

运镜: 决定镜头的动态轨迹。如:推、拉、摇、移、跟、升降、无人机航拍、手持摇晃等。

景别 : 决定画面的视野范围。如:远景、全景、中景、近景、特写等。

角度: 决定观看主体的视线高低。如:平视、仰拍、俯拍。

主体描述: 画面中核心的人、物或建筑的具体外观细节。

运动描述 : 主体在做什么,或者环境中正在发生什么物理变化。

环境氛围: 光影条件、天气状况及整体的情绪基调。

比如:

jimeng-2026-03-10-4843-缓慢推镜头,近景,仰拍。古代大户人家的院落中的正房,精致的飞檐翘角。细雨绵绵飘落....mp4下载 ↗

3、Seedance 2.0 相关案例展示

前面给出的那种“运镜+景别+角度+主体+运动+氛围”的格式,好处在于“稳”且“可控”。

它非常适合以前那种“手搓”视频的时代,也就是把分镜脚本拆分得极其细致,每一个动作都对应一个单一、简单的画面。如果你本身就是影视行业从业者,具备扎实的视听语言基础,懂得如何通过剪辑把这些单一的运镜素材拼凑起来,这么写当然毫无问题。

这是一种不会出错的提示词写法,但很多时候往往无法充分发挥出模型的想象力。

对于大多数普通的 AI 视频爱好者和刚入门的同学来说,往往不具备专业导演的运镜规划能力。

因此,只要把握住核心的主题和氛围,不去死板地限定单一的运镜、景别或拍摄角度,而是用概括性的语言让大模型自由发挥,反而会产生极其惊艳的效果。尤其是针对跳舞、打斗这种极其复杂的连续运动镜头,Seedance 2.0 这样的模型完全具备在一个 15 秒长镜头内自动调度机位的能力。

以跳舞视频来举例。可以看到,依然是上述提示词格式,我们将运镜、景别、角度这三个维度的描述改成更加概括性的指令,确实能够给我们意想不到的效果。

视频节点 5.mp4下载 ↗

如果我们在提示词中只写“三个女团成员跳舞”,当然也很有可能出现很惊艳的素材,但相对来说就没那么可控,抽卡率会稍微有点高。

当然,针对不同主体的视频素材,提示词的撰写方式会有所不同。一段视频究竟是充满张力,还是平静克制,其整体节奏、运镜等方面的差异都颇为显著。

要是有同学不清楚该如何撰写这类提示词,可以参考以下提示词模板。只需将其复制到任意一款大语言模型(如Gemini、ChatGPT、DeepSeek 等)中,开启深度思考模式后,输入你想要生成的主题,就能获得充分发挥 Seedance 2.0 视频模型能力的短视频提示词。

以下是一些采用Seedance 2.0 纯文生视频生成的案例:

> 一名身穿飘逸白衣的年轻女侠与一名身披灰袍的剑客正在一片竹林之中进行精彩的剑术切磋,两人都是单手持剑。请自由安排极具张力的武侠运镜,通过全景、中景、近景、特写等多个景别的丝滑切换,展现两人在竹叶间穿梭飞跃、身法灵动、剑风带动竹叶飞舞的精彩过程。两个人打得有来有回,一开始女侠被压制,随后女侠找准时机,将灰袍剑客击退。充分发挥模型的大动态运动捕捉能力,画面充满电影感、东方武侠的飘逸意境,极高画质。

jimeng-2026-03-12-2967-一名身穿飘逸白衣的年轻女侠与一名身披灰袍的剑客正在一片竹林之中进行精彩的剑术切磋....mp4下载 ↗

> 动态汽车广告。一辆流线型的银色顶级跑车正在荒芜的火星般红岩沙漠上狂飙。请自由安排极具速度感的运镜,通过车头呼啸而过带起红色沙尘的特写、车轮在悬崖边急速漂移的近景、以及跑车撕裂风沙全速前进的全景航拍,进行丝滑切换展现。发挥模型的大动态光影能力,体现出狂野、奢华与未来科技感。配上合适的文案。

jimeng-2026-03-11-9343-动态汽车广告。一辆流线型的银色顶级跑车正在荒芜的火星般红岩沙漠上狂飙。请自由安排....mp4下载 ↗

> 极具网感的高级电商美妆广告。一位妆容精致明艳的时尚女模正手持一支正红色口红。请采用充满张力的商业快剪运镜,在女模自信的面部特写、多角度展示口红膏体丝绒质感的微距镜头之间快速切换。女模将口红轻轻涂抹在唇上,对着镜头自信微笑,画外音清晰地说道:“这一抹红,让你掌控全场。” 画面色彩饱和度高,棚拍顶级商业打光,高保真画质。

jimeng-2026-03-11-6239-极具网感的高级电商美妆广告。一位妆容精致明艳的时尚女模正手持一支正红色口红。请采....mp4下载 ↗

> 野生动物纪录片素材。金色的非洲大草原上,一只成年猎豹正在追逐一只羚羊。请自由安排极具爆发力的野生动物运镜,通过微距特写猎豹起跑瞬间肌肉的紧绷与泥土的飞溅、近景跟随它冲刺时身体的极致拉伸、以及全景展现两只动物在广袤草原上生死时速的追逐过程。发挥高帧率和自然物理模拟能力,画面极具野性和生命张力。

jimeng-2026-03-11-5851-野生动物纪录片素材。金色的非洲大草原上,一只成年猎豹正在追逐一只羚羊。请自由安排....mp4下载 ↗

> 唯美东方古典意境视频素材。黄河之水从天际奔流而下,惊涛拍岸,画面转入一间古朴的酒肆,身穿狂放白衣的诗人正举起酒樽。请采用极其舒缓大气的运镜,从黄河宏大的全景航拍,平滑切镜到李白仰头饮酒的侧面中景,最后固定机位缓慢推进至他醉眼朦胧的特写。诗人将酒樽重重顿在木桌上,豪迈地高声吟诵:“君不见,黄河之水天上来,奔流到海不复回!” 画面呈现水墨画般的青冷色调,烛火摇曳,电影级东方美学质感。

jimeng-2026-03-11-8482-唯美东方古典意境视频素材。黄河之水从天际奔流而下,惊涛拍岸,画面转入一间古朴的酒....mp4下载 ↗

但对于需要做连续剧情的AI仿真人短剧来说,文生视频很难保证所需的人物一致性、场景一致性和风格一致性,因此文生视频不作为主要的使用手段。

四)图生视频

1、基本概述

在传统“手搓流”的AI视频创作过程中,图生视频(Image-to-Video)可以说是保持人物和场景一致性最重要的技术环节了,没有之一。

所谓图生视频,指的是 AI 依据你所提供的静态图片(首帧图),结合你撰写的提示词,对这张图片的下一秒、下一帧画面展开符合物理规律的“想象”,逐帧生成动态内容,最终连缀成一段视频。它的关键输入有两个:图片(决定视频的起始视觉状态) 和 提示词(决定视频的动态发展轨迹)。

在“参考生视频”技术成熟以前,若要制作前后连贯的剧情短片,图生视频是唯一的途径。

虽说在当下 AI 仿真人短剧的工作流中,凭借强大的“文/资生视频”能力,单纯的图生视频已不再是主力军,但它依旧是不可或缺的。对于复杂极限机位的定制、局部崩坏镜头的兜底补救、以及对特定分镜的绝对精细化控制,我们依然需要用到图生视频。

2、图生视频实操

1)操作界面

对于LibTV,上传一张图片后,在图片右边拖动新建一个视频节点,选择图生视频/首尾帧模式,再输入提示词,选择模型,即可生成视频。(几种模式的区别,直播课上会详细讲解)

图片展示了LibTV操作界面中添加节点的弹窗。弹窗内有多个节点选项,其中“上传”节点被蓝色框突出显示,其下方文字说明“可上传图片、视频、音频文件”。该图片与文档中介绍LibTV图生视频操作的内容相关,用于说明在LibTV上传一张图片后,需在图片右边拖动新建视频节点,选择“图生视频/首尾帧”模式,再输入提示词、选择模型,即可生成视频,此图直观呈现了“上传”节点的位置。
图片展示了LibTV操作界面中添加节点的弹窗。弹窗内有多个节点选项,其中“上传”节点被蓝色框突出显示,其下方文字说明“可上传图片、视频、音频文件”。该图片与文档中介绍LibTV图生视频操作的内容相关,用于说明在LibTV上传一张图片后,需在图片右边拖动新建视频节点,选择“图生视频/首尾帧”模式,再输入提示词、选择模型,即可生成视频,此图直观呈现了“上传”节点的位置。
图片展示了LibTV软件中图生视频的操作界面。画面左侧为一张古装人物图片,右侧是视频节点6,显示生成中9%。下方有“图生视频”“全能参考”“首尾帧”“图片参考”等选项卡,当前选中“图生视频”。下方还有一段提示词,描述了视频内容。该图片与上文介绍的LibTV图生视频操作流程相关,直观呈现了上传图片、选择模式、输入提示词等操作后的界面情况。
图片展示了LibTV软件中图生视频的操作界面。画面左侧为一张古装人物图片,右侧是视频节点6,显示生成中9%。下方有“图生视频”“全能参考”“首尾帧”“图片参考”等选项卡,当前选中“图生视频”。下方还有一段提示词,描述了视频内容。该图片与上文介绍的LibTV图生视频操作流程相关,直观呈现了上传图片、选择模式、输入提示词等操作后的界面情况。

对于即梦,我们要将模式切换到“首尾帧”模式,然后再上传图片输入提示词即可。

图片展示了Seedance 2.0 Fast的图生视频操作界面。左侧红框内为上传的图片,右侧弹出菜单中“首尾帧”模式被选中。该图片与上文提到的图生视频实操内容相关,用于说明在Seedance 2.0 Fast中,上传图片后,选择“图生视频/首尾帧”模式,再输入提示词、选择模型,即可生成视频的操作步骤。
图片展示了Seedance 2.0 Fast的图生视频操作界面。左侧红框内为上传的图片,右侧弹出菜单中“首尾帧”模式被选中。该图片与上文提到的图生视频实操内容相关,用于说明在Seedance 2.0 Fast中,上传图片后,选择“图生视频/首尾帧”模式,再输入提示词、选择模型,即可生成视频的操作步骤。

对于可灵,在生成-视频生成中,上传图片,再输入提示词即可。

图片展示了可灵视频生成界面。左侧有生成、创意图、资产等选项,当前选中“生成”。右侧上方有“图片生成”“视频生成”“动作控制”“数字人”选项,其中“视频生成”被红框突出显示。中间部分显示视频3.0功能介绍,下方有视频预览图,画面中多人在室内场景。右侧有“添加尾帧图(可选)”按钮及“历史创作”选项。该图片与上下文介绍的可灵视频生成操作流程相关,直观呈现了操作界面。
图片展示了可灵视频生成界面。左侧有生成、创意图、资产等选项,当前选中“生成”。右侧上方有“图片生成”“视频生成”“动作控制”“数字人”选项,其中“视频生成”被红框突出显示。中间部分显示视频3.0功能介绍,下方有视频预览图,画面中多人在室内场景。右侧有“添加尾帧图(可选)”按钮及“历史创作”选项。该图片与上下文介绍的可灵视频生成操作流程相关,直观呈现了操作界面。

2)图生视频提示词技巧

编写提示词这是很关键的一步。在提示词输入框中,清晰地描述你想要的视频效果。

图生视频的万能提示词结构:

跟文生视频的提示词写法几乎一样,但值得注意的是,由于图生视频的首帧图被已经固定,若要跟原本的首帧图保持一致,景别、角度以及画面氛围这几个方面的描述可以省略不写。

对于老版本的视频模型来说,这样的图生视频提示词写法生成的效果是很稳定的。

比如:

图片展示的是视频生成界面,左侧为视频画面,画面中是一位身着古装的女性,背景为中式建筑。右侧是视频节点11,显示生成进度为99%。下方有“图生视频”“图生视频”“图生视频”等标签,以及“标记”“特效”“运镜”等选项。画面底部有“Kling 2.5”“自适应 - 高品质”“5s”等信息。该图片与上下文紧密相关,是对视频生成操作中图生视频实操步骤的呈现,辅助说明视频生成及评估相关操作。
图片展示的是视频生成界面,左侧为视频画面,画面中是一位身着古装的女性,背景为中式建筑。右侧是视频节点11,显示生成进度为99%。下方有“图生视频”“图生视频”“图生视频”等标签,以及“标记”“特效”“运镜”等选项。画面底部有“Kling 2.5”“自适应 - 高品质”“5s”等信息。该图片与上下文紧密相关,是对视频生成操作中图生视频实操步骤的呈现,辅助说明视频生成及评估相关操作。
视频节点 11.mp4下载 ↗

视频生成完之后,我们需要评估下视频是不是符合我们的要求,

如果不符合要求,我们需要考虑下是哪块出了问题,是图片本身的问题还是提示词有问题?找到问题之后需要针对性修改。视频生成始终会存在抽卡(多次出视频)的过程,视频有一定的随机性,所以我们需要调整提示词来生成视频达到我们想要的效果。

再看一个走路的运动案例

zoulu.mp4下载 ↗

我们可以看到,基本上主体的运动效果比较稳定,运镜也符合我们的预期,都是单一的运镜,因为这两张图片已经将视频的景别、画风、拍摄角度、环境氛围基本确定好了,只要不做出额外的提示词修改需求,基本都能维持首帧图的这些基本特性。

像这样的素材在“手搓流”的时代,是非常合格的,因为只要分镜拆分得足够详细,40来个这样的几秒钟的片段即可拼成一部2分钟左右的短剧。

3)最新图生视频模型的玩法

目前主流的视频模型(如 Seedance 2.0、Kling 3.0、Wan 2.7等)已经彻底颠覆了传统的“手搓”玩法。它们不仅在物理规律上极其稳定,更引入了两个革命性的概念:

  • 音画同出:模型在生成视频画面的同时,原生、同步地生成包含对白唇形、物理拟音(如脚步声、水声)以及环境背景音的完整音频轨道。
  • 智能分镜:模型具备理解一段连贯叙事逻辑的能力。在一段视频的生成过程中,模型能够根据提示词的剧情走向,自动且平滑地进行不同景别和视角的镜头切换,如自动从全景切入特写,或在对话人物间进行正反打切换。

在实际操作中,我们只需要在前面基础图生视频的提示词公式之上,将主体的特征和动作交互交代清楚,并用双引号(“”)附上具体的台词文本,再配合少量的运镜说明即可。通过这种提示词写法,模型就能非常听话地直接生成带有原生台词的动态画面。

对于有剧情的 AI 仿真人短剧来说,这无疑是一项颠覆性的功能。它彻底省去了繁琐的后期配音和AI对口型环节,将以往做真人画风影片时那种极易出戏的机械感和AI 味降到了最低。同时,智能分镜功能的加持,使得角色对话时的正反打镜头、情绪特写的推拉,都能在一气呵成中生成。我们再也无需为了拼凑一场对话戏,去耗费大量时间生成不同景别、不同构图的单张人物分镜图了。

例如:

这是我们上传的首帧图:

图片展示的是上传的首帧图,画面中一男一女身着古装,坐在室内。女子身着淡紫色上衣和白色下裙,头戴发饰,面带微笑;男子则着深蓝色上衣和白色下裙,头戴发髻,面带严肃表情。两人坐在木制椅子上,面前有茶几,上面摆放着茶具。背景为中式装饰,有屏风、绿植和烛台等。该图片用于与Seedance 2.0、可灵视频3.0等图生视频模型效果进行对比。
图片展示的是上传的首帧图,画面中一男一女身着古装,坐在室内。女子身着淡紫色上衣和白色下裙,头戴发饰,面带微笑;男子则着深蓝色上衣和白色下裙,头戴发髻,面带严肃表情。两人坐在木制椅子上,面前有茶几,上面摆放着茶具。背景为中式装饰,有屏风、绿植和烛台等。该图片用于与Seedance 2.0、可灵视频3.0等图生视频模型效果进行对比。

大家可以对比一下Seedance 2.0、可灵视频3.0二者的效果。

##### (1)a. Seedance的效果

提示词响应得很准确,先是缓缓推进,随后两个人物对话的正反打,最可贵的是,台词没有出现任何嘴瓢,音效恰到好处,嘴型对得严丝合缝,完全看不出来一点AI感。

seedance.mp4下载 ↗

但是Seedance 2.0在图生视频的选项下没办法固定人物的脸,只有在全能参考模式下才能够进行角色参考,这一点,我们会在后面关于参考生视频的部分详细讲解。

因为仅上传了男女对坐的接近全景图片,所以当模型自行切镜时,切镜方式就会比较随机。首帧图中女人的头有些偏,看不到正脸与完整头饰。由此,当切成女主近景时,脸和头饰的还原度都欠佳。如果仅将此作为一个独立片段来看,这个素材没有问题。但若是放在完整剧情的短剧中,在人物一致性方面,就表现得不尽如人意了。

所以,对于仿真人短剧而言,Seedance 2.0 的图生视频功能,尽量仅用于简单的远全景分镜素材。当需要近景、特写画面时,最好还是采用全能参考模式。

首帧图
首帧图
切近景
切近景
女主实际长相
女主实际长相

当然,如果是在即梦官网中使用这种真人图片,Seedance 2.0 大概率会给你下面这样的结果,我们后面在参考生视频那里会专门教大家如何绕开针对真实人脸的限制。

图片展示的是Seedance 2.0生成的视频片段界面。画面中,穿着淡紫色汉服的女人和穿着深青色汉服的男人坐在太师椅上交谈,镜头推进,女人拿起茶盖抿茶并说话,男性低着头回应。画面下方提示识别到上传素材中包含人脸信息,需调整素材再试。下方有“重新编辑”“再次生成”按钮及“...”更多选项。该图片与上下文关系紧密,直观呈现了Seedance 2.0在处理真人图片时的生成效果,用于说明其在仿真人短剧中的局限性。
图片展示的是Seedance 2.0生成的视频片段界面。画面中,穿着淡紫色汉服的女人和穿着深青色汉服的男人坐在太师椅上交谈,镜头推进,女人拿起茶盖抿茶并说话,男性低着头回应。画面下方提示识别到上传素材中包含人脸信息,需调整素材再试。下方有“重新编辑”“再次生成”按钮及“...”更多选项。该图片与上下文关系紧密,直观呈现了Seedance 2.0在处理真人图片时的生成效果,用于说明其在仿真人短剧中的局限性。

##### (2)b. 可灵的效果

可灵支持提前创建好主体库,不论是在可灵视频3.0模型(kling 3.0)进行图生视频,还是在可灵视频 3.0 Omni模型(kling o3)进行参考生视频,都支持固定角色。

图片展示的是可灵视频3.0模型(kling 3.0)中“我的主体”界面。左侧灰色区域有“+创建主体”字样。右侧有三张图片,分别是“陆远铮”“沈宁”“年轻中国女人”,每张图片下方标注“已加载全部”。该图片与上下文紧密相关,用于说明可灵支持提前创建好主体库,不论是在可灵视频3.0模型进行图生视频,还是在可灵视频3.0 Omni模型进行参考生视频,都支持固定角色,可看到不论如何切镜,人脸都始终统一。
图片展示的是可灵视频3.0模型(kling 3.0)中“我的主体”界面。左侧灰色区域有“+创建主体”字样。右侧有三张图片,分别是“陆远铮”“沈宁”“年轻中国女人”,每张图片下方标注“已加载全部”。该图片与上下文紧密相关,用于说明可灵支持提前创建好主体库,不论是在可灵视频3.0模型进行图生视频,还是在可灵视频3.0 Omni模型进行参考生视频,都支持固定角色,可看到不论如何切镜,人脸都始终统一。
图片展示的是可灵视频3.0模型(kling 3.0)进行图生视频操作界面。画面中显示视频节点3,主体库正在生成中,进度为3%。下方有“文生视频”“图生视频”“视频参考”“图片参考”四个选项卡,其中“图生视频”选项被蓝色框突出显示。画面左下角有提示词,描述了古代场景中人物对话内容。右下角显示模型为Kling 3.0,标准为14s,智能分镜已开启。该图片与上下文介绍的可灵视频3.0模型图生视频功能相契合。
图片展示的是可灵视频3.0模型(kling 3.0)进行图生视频操作界面。画面中显示视频节点3,主体库正在生成中,进度为3%。下方有“文生视频”“图生视频”“视频参考”“图片参考”四个选项卡,其中“图生视频”选项被蓝色框突出显示。画面左下角有提示词,描述了古代场景中人物对话内容。右下角显示模型为Kling 3.0,标准为14s,智能分镜已开启。该图片与上下文介绍的可灵视频3.0模型图生视频功能相契合。

因此我们可以看到不论如何切镜,人脸都始终统一。女人的发饰还原得很到位。

首帧图
首帧图
女主实际长相
女主实际长相
可灵切近景
可灵切近景

但可灵对于智能切分镜这个功能,还是很依赖于提示词的,如果提示词没有详细写景别和运镜,则有可能出现下面这种一镜到底的样子:

不开启智能分镜.mp4下载 ↗

但可灵支持自定义分镜,只需要将镜头人为地通过提示词拆分一下,就能非常稳地生成人物对话的正反打镜头了。

图片展示的是可灵图生视频界面,画面中有一个正在生成中的视频节点3,显示“生成中 11%... 取消”。下方是视频描述,描述了古代府邸正院会客厅中人物对话的场景。画面右下角有“智能分镜”按钮,其右侧有数字“5”,并有蓝色箭头指向。该图片与上下文紧密相关,直观呈现了可灵支持自定义分镜,通过提示词拆分镜头后生成人物对话正反打镜头的操作效果。
图片展示的是可灵图生视频界面,画面中有一个正在生成中的视频节点3,显示“生成中 11%... 取消”。下方是视频描述,描述了古代府邸正院会客厅中人物对话的场景。画面右下角有“智能分镜”按钮,其右侧有数字“5”,并有蓝色箭头指向。该图片与上下文紧密相关,直观呈现了可灵支持自定义分镜,通过提示词拆分镜头后生成人物对话正反打镜头的操作效果。
图片展示的是可灵图生视频的分镜设置界面。界面上方有“智能分镜”开关,下方有多个分镜设置区域,每个区域包含分镜编号、时长和描述。如分镜1描述为“中国古代侯府正院会客厅,穿着淡紫色汉服的女人和穿着深青色汉服的男人坐 在太师椅上,正在交谈”,分镜总时长显示为14s。该图片与上下文紧密相关,直观呈现了可灵支持自定义分镜,通过提示词拆分镜头以生成人物对话正反打镜头的操作方式。
图片展示的是可灵图生视频的分镜设置界面。界面上方有“智能分镜”开关,下方有多个分镜设置区域,每个区域包含分镜编号、时长和描述。如分镜1描述为“中国古代侯府正院会客厅,穿着淡紫色汉服的女人和穿着深青色汉服的男人坐 在太师椅上,正在交谈”,分镜总时长显示为14s。该图片与上下文紧密相关,直观呈现了可灵支持自定义分镜,通过提示词拆分镜头以生成人物对话正反打镜头的操作方式。
视频节点 3.mp4下载 ↗

3、首尾帧生视频

首尾帧生视频是一种特殊的图生视频功能。它可以让你精确控制视频的起始画面和结束画面。掌握好首尾帧技术,你就能制作出转场流畅、衔接自然的AI仿真人短剧镜头。

1)首尾帧的功能和作用

##### (1)A. 精确控制视频的起止状态

首尾帧最基本的作用就是,你可以明确告诉AI,视频要从什么画面开始,到什么画面结束。这样生成的视频就不会出现起始或结尾画面不符合你预期的情况。

比如,你想做一个人物从坐着站起来的镜头。你可以用坐着的图片作为首帧,用站着的图片作为尾帧,AI就会生成一个从坐到站的完整动作。

首帧是一个男人坐在椅子上,尾帧是这个男人站起身来。

分别上传这两张图片,输入视频提示词:

首帧图
首帧图
尾帧图
尾帧图
图片展示了Seedance 2.0中首尾帧的界面。左侧为视频画面,标注“首帧图”和“尾帧图”,分别对应视频开头和结尾的场景。右侧是视频节点编辑区域,有“视频节点1”和“视频节点2”,其中“视频节点2”被蓝色箭头指向。下方是参考图选择区域,有“文本视频”“全部参考”“图生视频”“图片参考”选项,其中“图生视频”被蓝色框突出显示。该图与上下文介绍的首尾帧功能和作用相关,直观呈现了首尾帧在视频生成中的应用。
图片展示了Seedance 2.0中首尾帧的界面。左侧为视频画面,标注“首帧图”和“尾帧图”,分别对应视频开头和结尾的场景。右侧是视频节点编辑区域,有“视频节点1”和“视频节点2”,其中“视频节点2”被蓝色箭头指向。下方是参考图选择区域,有“文本视频”“全部参考”“图生视频”“图片参考”选项,其中“图生视频”被蓝色框突出显示。该图与上下文介绍的首尾帧功能和作用相关,直观呈现了首尾帧在视频生成中的应用。
kling_20260309_作品_沈宁_粉衣女人_一边_5550_0.mp4下载 ↗

##### (2)B. 控制动作的精确性

对于一些复杂动作,单纯依靠提示词来描述,AI 或许无法精准理解,也未必能生成符合你预期的画面。但要是你能提供首帧与尾帧画面,AI 便能明确动作需从何种姿态过渡到何种姿态,如此一来,生成的动作就会精确许多。

例如我们制作一个芭蕾舞舞蹈员跳舞运动的视频:

首帧
首帧
尾帧
尾帧

分别上传两张图,这两张图是同一个人物不同的动作,输入视频提示词:

vidu-video-3066997313745755.mp4下载 ↗

对于某些炫技的动作,如果对尾帧效果有着强烈的掌控欲,期望结尾能呈现出特定的效果,那么不妨提前将尾帧图生成出来。而后,通过利用首帧和尾帧来生成视频,从而实现对整个动作呈现效果的有效控制。

例如这个3d风格的特效:

首帧
首帧
尾帧
尾帧

分别上传两张图,这两张图是同一个人物不同的动作,输入视频提示词:

kling_20251224_图生视频_他拿住枪身后_出现强_4951_0.mp4下载 ↗

##### (3)C. 创造性的转场效果

通过设计特殊的首尾帧,可以创造出一些有创意的转场效果。比如,首帧是一个场景,尾帧是完全不同的场景,AI会生成一个从一个场景过渡到另一个场景的视频,这就形成了一个转场。通过首尾帧可以让转场更加丝滑和自然。

第一帧
第一帧
第二帧
第二帧
第三帧
第三帧
破碎.mp4下载 ↗

##### (4)D. 制造一镜到底

在前面内容的基础上,若想要做出长镜头效果,从理论层面来讲,仅需将每一帧图片按照首尾相接的方式串联起来,借助首尾帧模式生成视频,最后在剪辑环节中对速度进行调整,如此便能获得一镜到底的长素材。

就像下面这个例子,我们预先精心设计好了六张分镜图,最终成功串起了一段从天文望远镜开始,直至宇宙深渊处诡异生物的连续拉远的一镜到底画面。

01
01
02
02
03
03
04
04
05
05
06
06
宇宙穿梭.mp4下载 ↗

D、变身特效

做一些玄幻/都市高武题材的短剧时,想精准控制一些特效,也可以提前将首尾帧的图准备好,再利用首尾帧生成视频。

首帧:变身前
首帧:变身前
尾帧:变身后
尾帧:变身后
变身视频.mp4下载 ↗

2)首尾帧图片要点

A. 首帧图片注意事项

清晰度要高: 首帧图片一定要清晰,因为这是视频的起点,如果起点就模糊,整个视频的质量都会受影响。

构图要合理: 首帧的构图要考虑到后续的动作和运镜。比如,如果你要做一个人物从左往右走的镜头,首帧中人物应该在画面左侧,右侧留出空间。

图片展示了一位年轻男子在街道上行走的场景。他穿着牛仔夹克和牛仔裤,侧身面向画面右侧,步伐轻快。街道旁有玻璃门的店铺,店铺上方有“Cinestix”和“Lolli”等标识。街道右侧有黄色人行道砖,远处可见建筑和路灯。图片与上下文关系紧密,用于说明首尾帧图片要点中,人物从左往右走的镜头首帧中人物应位于画面左侧,右侧留出空间,且要清楚展示人物姿态、表情等起始状态。
图片展示了一位年轻男子在街道上行走的场景。他穿着牛仔夹克和牛仔裤,侧身面向画面右侧,步伐轻快。街道旁有玻璃门的店铺,店铺上方有“Cinestix”和“Lolli”等标识。街道右侧有黄色人行道砖,远处可见建筑和路灯。图片与上下文关系紧密,用于说明首尾帧图片要点中,人物从左往右走的镜头首帧中人物应位于画面左侧,右侧留出空间,且要清楚展示人物姿态、表情等起始状态。

状态要明确: 首帧要清楚地展示起始状态。比如,如果是人物动作,要清楚地看到人物的姿态、表情;如果是场景,要清楚地看到场景的布局。

图片展示了一位拳击手在拳击台上训练的场景。拳击手穿着黑色背心、黑色短裤和红色护腕,戴着红色拳击手套,双手抬起,做出防御姿势。拳击台四周有红色和白色的绳子围栏,背景中可见模糊的观众和灯光,整体氛围紧张且充满动感。该图片用于说明首尾帧图片要点中尾帧图片注意事项,即尾帧展示的状态要从首帧自然过渡,不能跳跃太大,如首帧是人站着,尾帧不能突然变成躺着。
图片展示了一位拳击手在拳击台上训练的场景。拳击手穿着黑色背心、黑色短裤和红色护腕,戴着红色拳击手套,双手抬起,做出防御姿势。拳击台四周有红色和白色的绳子围栏,背景中可见模糊的观众和灯光,整体氛围紧张且充满动感。该图片用于说明首尾帧图片要点中尾帧图片注意事项,即尾帧展示的状态要从首帧自然过渡,不能跳跃太大,如首帧是人站着,尾帧不能突然变成躺着。

B. 尾帧图片注意事项

和首帧风格一致: 尾帧的风格、画质、色调要尽量和首帧保持一致,这样整个视频才协调。

状态要合理: 尾帧展示的状态要是从首帧自然过渡到的一个状态,不能跳跃太大。比如,首帧是一个人站着,尾帧不能突然变成躺着,这个变化太大,AI很难生成自然的过渡。

图片展示了一朵玫瑰花苞,外层花瓣呈粉红色,内层花瓣为深红色,花苞上附着水珠,背景模糊,有水珠和绿色叶片。这与文档中输入的提示词相契合,提示词要求玫瑰花苞缓慢绽放,外层花瓣逐渐向外舒展,露出内部深红色花瓣,晨露在花瓣上闪耀,自然光线柔和照射,突出花瓣质感和鲜艳红色,展现生命绽放的美丽瞬间。
图片展示了一朵玫瑰花苞,外层花瓣呈粉红色,内层花瓣为深红色,花苞上附着水珠,背景模糊,有水珠和绿色叶片。这与文档中输入的提示词相契合,提示词要求玫瑰花苞缓慢绽放,外层花瓣逐渐向外舒展,露出内部深红色花瓣,晨露在花瓣上闪耀,自然光线柔和照射,突出花瓣质感和鲜艳红色,展现生命绽放的美丽瞬间。
图片展示了一朵玫瑰花苞,花瓣呈粉红色,外层花瓣逐渐向外舒展,露出内部深红色的花瓣。花瓣上点缀着晶莹的水珠,背景模糊,有绿色植物和水珠飞溅的动态效果。这与文档中输入的提示词相契合,提示词要求玫瑰花苞缓慢绽放,晨露在花瓣上闪耀,自然光线柔和照射,突出花瓣质感和鲜艳红色,展现生命绽放的美丽瞬间。
图片展示了一朵玫瑰花苞,花瓣呈粉红色,外层花瓣逐渐向外舒展,露出内部深红色的花瓣。花瓣上点缀着晶莹的水珠,背景模糊,有绿色植物和水珠飞溅的动态效果。这与文档中输入的提示词相契合,提示词要求玫瑰花苞缓慢绽放,晨露在花瓣上闪耀,自然光线柔和照射,突出花瓣质感和鲜艳红色,展现生命绽放的美丽瞬间。

输入提示词

vidu-video-3067094649122056.mp4下载 ↗

构图要考虑衔接: 如果尾帧后面还有其他镜头,尾帧的构图要考虑和下一个镜头的衔接。

细节要清晰: 尾帧的细节要清晰,特别是如果尾帧是一个特写或者重要的画面,更要注意细节的质量。

3)首尾帧提示词写作要点

A. 首帧提示词要点

从首帧开始的变化: 明确说明从首帧开始,画面会如何变化。

运镜的起始方式: 如果有运镜,要说明镜头从什么位置、什么角度开始运动。

动作的起始细节: 如果是复杂动作,可以描述一下动作的起始细节。

B. 尾帧提示词要点

到达尾帧的过程: 说明画面如何从首帧过渡到尾帧。

动作的完成状态: 如果是动作类镜头,要描述动作如何完成,最终停在什么状态。

氛围的延续或变化: 说明从首帧到尾帧,氛围是保持不变还是有所变化。

4)如何确保首尾帧的连贯性

首尾帧的连贯性是很重要的,如果首尾帧之间的变化太突兀,AI生成的过渡过程可能会不自然,甚至出现问题。

A. 首尾帧的变化要适度

首尾帧之间的差异不要太大。在一个4秒的视频中,首尾帧的变化应该是一个人在4秒内可以完成的变化。

比如,4秒内,一个人可以转个身、走几步、做个简单的手势,但不可能从室内突然到室外,或者从白天突然到夜晚。

B. 保持视角和比例的一致性

首尾帧的拍摄角度和人物/物体的比例要相近。如果首帧是正面特写,尾帧突然变成侧面全身,这个变化太大,AI很难处理。

C. 保持光线和色调的连续性

首尾帧的光线方向、强度和色调要保持连续性。不要首帧是暖色调,尾帧突然变成冷色调,这会让AI困惑。

D. 用提示词明确过渡过程

在提示词中,详细描述从首帧到尾帧的过渡过程,让AI知道中间应该发生什么。

例如:从首帧开始,人物缓慢转身,身体从正面转到侧面,最后停在尾帧的背面姿态,整个过程流畅自然,没有停顿

5) 首尾帧在短剧中的应用

前面讲到的首尾帧使用方法,更多是一个理论层面的方法论。

但在实际做短剧的时候,我反而建议大家尽量少用首尾帧。

首尾帧更适合以前那种纯手搓的工作流。比如你想做一个比较长的连续镜头,或者你想非常精准地控制某个动作的开始和结束,这种情况下首尾帧会有它的价值。

但现在做短剧,大多数镜头其实不需要这么复杂。

除非你的两个镜头之间需要非常精准的动作控制,而且你还能保证中间的环境、人物、道具不会出现穿帮,否则一般情况下,不建议大家频繁使用首尾帧。

更稳妥的方式,还是用固定镜头加硬切。

尤其是对短剧来说,镜头之间切得干净、节奏明确,很多时候比强行做一个连续运动更重要。硬用首尾帧去接,反而很容易出现人物变形、背景穿帮、动作接不上,最后看起来还不如直接切镜头。

当然,也不是说首尾帧完全不能用。

如果某几个画面确实需要炫技,比如一镜到底的穿梭镜头、角色变身镜头、特殊转场镜头,或者你想做一个非常明确的动作衔接,那可以用首尾帧去控制。

但大家要记住,它不是短剧制作的默认方案。短剧里大多数正常叙事镜头,直接用固定镜头硬切,反而更稳、更干净,也更符合短剧节奏。

五)🌟五)参考生视频

我们了解了最基本的文生视频和图生视频,接下来我们来说说现在制作AI仿真人短剧最重要的一项技术——参考生视频。

1、基本概述

在 Seedance 2.0、kling O3、Wan 2.7、Happy Horse 1.0 等新一代模型出来之前,参考生视频通常可以简单理解为“参考图生视频”。它的核心作用是:通过上传一张或多张参考图片(如角色设定图、场景概念图),让 AI 学习这些图片中的主体特征、面部细节、美术风格等信息,然后在完全脱离原图构图的情况下,生成一段包含该主体的新视频。

简单来说,就是你告诉 AI:"我要生成一段全新的视频,但里面的人物长相、衣服款式和场景风格,必须严格和我上传的这些参考资产保持一致。"

随着主流视频大模型的疯狂迭代,现在的参考维度早已不再局限于图片。

目前,kling O3、Happy Horse 1.0等模型都已经支持上传图片和视频作为参考(参考视频的动作或运镜);而Seedance 2.0、Wan 2.7甚至支持同步上传音频(提取声音、音色)作为参考。基于这种多模态的参考能力,Seedance 2.0 将这一模式精准地定义为“全能参考”。这标志着 AI 视频正式从抽卡时代迈入了资产直驱时代。

图片展示了参考生视频的示例,包含多张人物图片、音频文件及一张场景图片。人物图片有身穿古装的男子、女子等,标注了“此人参”“此音参”等。音频文件有“音频1”“音频2”“音频3”等。场景图片为室内环境。图片下方文字说明了参考内容,如人物声音作为陆老夫人,图片1的音色,人物的站立位置关系参考图等,体现了参考生视频中多模态参考的特点。
图片展示了参考生视频的示例,包含多张人物图片、音频文件及一张场景图片。人物图片有身穿古装的男子、女子等,标注了“此人参”“此音参”等。音频文件有“音频1”“音频2”“音频3”等。场景图片为室内环境。图片下方文字说明了参考内容,如人物声音作为陆老夫人,图片1的音色,人物的站立位置关系参考图等,体现了参考生视频中多模态参考的特点。

2、参考生视频的优势

1)角色、场景的高度一致性 这是AI仿真人短剧的生命线。不论是特写、中景还是全景,不论角色是哭是笑,只要锁定了参考资产,AI 就能确保同一集里男女主的长相尽可能保持一致,场景也不会发生诡异的突变。当然效果不一定达到百分百。

图片展示的是Seedance 2.0平台中的人物素材界面。界面上方有“我的”“社区”等导航栏,下方搜索框提示可搜索主体名称/系列/描述。界面中有“全部”“人物”“场景”“女生”“特效”等分类标签,当前选中“人物”标签。下方展示了多个人物素材缩略图,如陆老夫人、沈宁宁、沈宁、绷带怪尸等,每个缩略图下方有对应的人物名称。该图片与上下文介绍的参考生视频优势中“摆脱费时费力的‘手搓流’”内容相关,直观呈现了可利用的人物素材。
图片展示的是Seedance 2.0平台中的人物素材界面。界面上方有“我的”“社区”等导航栏,下方搜索框提示可搜索主体名称/系列/描述。界面中有“全部”“人物”“场景”“女生”“特效”等分类标签,当前选中“人物”标签。下方展示了多个人物素材缩略图,如陆老夫人、沈宁宁、沈宁、绷带怪尸等,每个缩略图下方有对应的人物名称。该图片与上下文介绍的参考生视频优势中“摆脱费时费力的‘手搓流’”内容相关,直观呈现了可利用的人物素材。

2)摆脱费时费力的“手搓流”

以往我们需要利用 MJ 或即梦生图模型,反复修改分镜图,甚至要在 PS 里修补细节,确认无误后才能拿去图生视频。现在,只需要准备好我们在第二节课讲过的核心资产(如角色的四视图、一张主场景图),就能直接输入剧本提示词,让 AI 替你完成所有的镜头调度与生成。

图片展示的是Seedance 2.0视频生成界面,左侧为音频编辑区域,有音频波形图。右侧是视频预览窗口,显示两人对话场景,画面下方有“让我和他见上一见”字幕。底部有“全能参考”“图生视频”“简尾帧”“图片参考”等选项卡,当前选中“图片参考”,下方有多个图片缩略图及对应提示词。该图片与上下文介绍参考生视频优势及提示词写法的内容相关,直观呈现了视频生成时的界面及参考图片提示词的设置情况。
图片展示的是Seedance 2.0视频生成界面,左侧为音频编辑区域,有音频波形图。右侧是视频预览窗口,显示两人对话场景,画面下方有“让我和他见上一见”字幕。底部有“全能参考”“图生视频”“简尾帧”“图片参考”等选项卡,当前选中“图片参考”,下方有多个图片缩略图及对应提示词。该图片与上下文介绍参考生视频优势及提示词写法的内容相关,直观呈现了视频生成时的界面及参考图片提示词的设置情况。

3)降低视频生成的抽卡次数

参考生视频因为有了“资产锚点”的强力约束,大模型在生成时就不容易“放飞自我”或产生严重幻觉,从而能够更快、更精准地命中我们想要的效果,极大地节省了算力成本和时间。

3、参考生视频的提示词写法

由于参考生视频不再受限于“首帧图的构图”,它在提示词的撰写逻辑上,其实更接近于我们上一章讲的文生视频全能模板,但必须在提示词中明确调用参考资产。

核心提示词结构:

其中: 上传了图片/视频/音频等素材后,可以在输入提示词的时候@角色/@道具/@场景图@任意其他参考图等(在seedance中还可以@音频)

图片展示了Seedance 2.0软件界面,用于视频生成。画面中呈现了多个视频片段缩略图,可进行全屏参考、视频参考、图片参考等操作。下方有角色、道具、场景图等素材选项,以及“@音频”按钮。底部显示视频时长9:16、分辨率720P、帧率15s、清晰度405。该图片与上下文介绍的参考生视频优势相关,直观呈现了上传素材后在输入提示词时可@角色等素材的功能。
图片展示了Seedance 2.0软件界面,用于视频生成。画面中呈现了多个视频片段缩略图,可进行全屏参考、视频参考、图片参考等操作。下方有角色、道具、场景图等素材选项,以及“@音频”按钮。底部显示视频时长9:16、分辨率720P、帧率15s、清晰度405。该图片与上下文介绍的参考生视频优势相关,直观呈现了上传素材后在输入提示词时可@角色等素材的功能。

可能没有上手实操过的同学,现在依旧有些懵。不要怕,工具都不能,只要实践过一次,相信大家都能够熟练掌握的。接下来,将给大家详细介绍这三款工具的使用技巧。

4、Seedance 2.0全能参考的使用技巧

1)基本操作

  • 多模态全能参考:文本、图像、视频、音频混合输入单次最多 12 个参考文件(图像≤9 张、视频≤3 段、音频≤3 段)
  • 智能分镜与影视级运镜:可像专业导演一样自动调度画面,完成景别规划、视角切换与镜头运动设计,同步匹配音效与音乐,直出专业级视听效果
  • 视频智能复刻:还原参考视频或音频中的 人物动作、角色走位、分镜运镜、视觉特效与音乐风格,无论是大片级镜头语言,还是爆款运镜节奏,都能高效复现。
  • 视频编辑:支持元素增删改换、背景替换,以及风格、天气、颜色、材质、景别视角调整,
  • 视频延展:无限延展续拍与多段智能衔接
  • 角色、场景、产品画面稳定统一,细小文字清晰呈现
  • 物理更合理、动作更自然、理解更精准,复杂场景稳定输出

LibTV操作界面

使用方法:进入后,再做左下角切换模型能力

  • Seedance 2.0 支持「首尾帧」和「全能参考」入口。

若只上传首帧图 + 提示词,可走首尾帧入口;如需多模态(图、视频、音频、文本)组合输入,则需进入全能参考入口

  • 当前支持的交互方式是通过“@素材名”来指定每个图片、视频、音频的用途,例如:@图片1 作为首帧,@视频1 参考镜头语言,@音频1 用于配乐
图片展示的是即梦创作界面中全能参考模式下的操作界面。画面中有一个视频节点3,下方有多个标签,其中“全能参考”标签被选中。下方还显示了“图片1”和“图片2”的缩略图,以及一段描述文字,内容为让图片1和图片2在桃花林中打斗,女性角色挥动铁扇等场景描述。该图片与上下文紧密相关,直观呈现了全能参考模式下上传素材、选择参考及输入提示词的操作界面。
图片展示的是即梦创作界面中全能参考模式下的操作界面。画面中有一个视频节点3,下方有多个标签,其中“全能参考”标签被选中。下方还显示了“图片1”和“图片2”的缩略图,以及一段描述文字,内容为让图片1和图片2在桃花林中打斗,女性角色挥动铁扇等场景描述。该图片与上下文紧密相关,直观呈现了全能参考模式下上传素材、选择参考及输入提示词的操作界面。

即梦操作界面 (使用libtv的同学可以不用看)

在即梦创作界面,切换到全能参考模式

图片展示了即梦视频生成界面中“全能参考”模式的设置。界面上方有“开启你的视频生成即刻造梦”的提示,下方有“上传1-5张参考图或视频、输入文字,自由组合图、文、音、视频多元蒙,定义精准互动”等内容。在“全能参考”模式下,有“首尾帧”“智能帧”“主体参考”三个选项,其中“全能参考”被红色框突出显示。该图片与上下文紧密相关,直观呈现了在即梦创作界面切换到全能参考模式后,如何选择不同参考方式的操作界面。
图片展示了即梦视频生成界面中“全能参考”模式的设置。界面上方有“开启你的视频生成即刻造梦”的提示,下方有“上传1-5张参考图或视频、输入文字,自由组合图、文、音、视频多元蒙,定义精准互动”等内容。在“全能参考”模式下,有“首尾帧”“智能帧”“主体参考”三个选项,其中“全能参考”被红色框突出显示。该图片与上下文紧密相关,直观呈现了在即梦创作界面切换到全能参考模式后,如何选择不同参考方式的操作界面。

全能参考模式下如何@:

方法1:输入“@”唤起参考调用

图片展示的是即梦创作界面中全能参考模式下@素材的操作示例。画面中显示了一张“主体1”中的Labubu在“主体2”的基础上,开着“主体3”的小米YUKI橙色跑车的图片,下方有“悬停预览”“@”唤起参考调用等操作提示。在“@”唤起参考调用下拉菜单中,有“悬停1”“悬停2”“图片1”等选项。该图片与上下文紧密相关,直观呈现了全能参考模式下@素材的具体操作步骤和界面情况。
图片展示的是即梦创作界面中全能参考模式下@素材的操作示例。画面中显示了一张“主体1”中的Labubu在“主体2”的基础上,开着“主体3”的小米YUKI橙色跑车的图片,下方有“悬停预览”“@”唤起参考调用等操作提示。在“@”唤起参考调用下拉菜单中,有“悬停1”“悬停2”“图片1”等选项。该图片与上下文紧密相关,直观呈现了全能参考模式下@素材的具体操作步骤和界面情况。

*输入“@”*

图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1”字样,表明该图片被指定为参考素材。该图片与上下文关系紧密,是对上文提到的“@素材名”指定图片、视频、音频用途操作的直观呈现,帮助用户理解在全能参考模式下如何通过输入“@”唤起参考调用,选择参考并输入提示词。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1”字样,表明该图片被指定为参考素材。该图片与上下文关系紧密,是对上文提到的“@素材名”指定图片、视频、音频用途操作的直观呈现,帮助用户理解在全能参考模式下如何通过输入“@”唤起参考调用,选择参考并输入提示词。

*选择参考,落入输入框*

图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1作为首帧”“@视频1参考镜头语言”“@音频1用于配乐”的提示。该图片与上下文紧密相关,是对“@素材名”指定图片、视频、音频用途操作的直观呈现,帮助用户理解在全能参考模式下如何通过“@”唤起参考调用并输入提示词。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1作为首帧”“@视频1参考镜头语言”“@音频1用于配乐”的提示。该图片与上下文紧密相关,是对“@素材名”指定图片、视频、音频用途操作的直观呈现,帮助用户理解在全能参考模式下如何通过“@”唤起参考调用并输入提示词。

*输入提示词*

方法2:点击参数工具“@”唤起参考调用

图片展示的是即梦创作界面中全能参考模式下的操作示例。画面中显示了上传的图片、视频、音频素材,如“主体1中的Labubu在小米12的车里”图片、“主体1中的小米12的橙色跑车”图片等。右侧有“视频1”“图片1”等素材选项。下方有“Seedance 2.0”“全能参考”等操作按钮,以及“16:9”“720P”等视频参数设置。该图与上下文介绍的全能参考模式下@素材的操作方法相呼应,直观呈现了操作后的界面情况。
图片展示的是即梦创作界面中全能参考模式下的操作示例。画面中显示了上传的图片、视频、音频素材,如“主体1中的Labubu在小米12的车里”图片、“主体1中的小米12的橙色跑车”图片等。右侧有“视频1”“图片1”等素材选项。下方有“Seedance 2.0”“全能参考”等操作按钮,以及“16:9”“720P”等视频参数设置。该图与上下文介绍的全能参考模式下@素材的操作方法相呼应,直观呈现了操作后的界面情况。

*点击“@”*

图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1”字样,表明该图片被指定为参考素材。该图片与上下文紧密相关,是对上文提到的“@图片1作为首帧”操作示例的呈现,直观展示了在全能参考模式下如何通过“@”唤起参考调用并选择参考素材的操作效果。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服、头戴兔耳朵帽子的卡通兔子。下方有“@图片1”字样,表明该图片被指定为参考素材。该图片与上下文紧密相关,是对上文提到的“@图片1作为首帧”操作示例的呈现,直观展示了在全能参考模式下如何通过“@”唤起参考调用并选择参考素材的操作效果。

*选择参考,落入输入框*

图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服的卡通兔子。下方有“@图片1作为首帧”等提示,以及“Seedance 2.0”“超全能参考”“16:9”“720P”等参数选项。该图片与上文介绍的全能参考使用技巧相关,直观呈现了在全能参考模式下,通过“@”唤起参考调用,选择参考并输入提示词后,上传素材的示例效果。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中是一辆橙色跑车,车前坐着一只穿着棕色衣服的卡通兔子。下方有“@图片1作为首帧”等提示,以及“Seedance 2.0”“超全能参考”“16:9”“720P”等参数选项。该图片与上文介绍的全能参考使用技巧相关,直观呈现了在全能参考模式下,通过“@”唤起参考调用,选择参考并输入提示词后,上传素材的示例效果。

*输入提示词*

上传素材后,图片、视频、音频都支持悬停预览

图片展示的是即梦生成器界面,主体为一个穿着棕色毛绒外套、戴着棕色帽子的卡通兔子坐在橙色跑车里,背景是绿色草地。下方有“@图片1作为首帧”字样。界面右侧有“@素材名”输入框,提示“@图片1作为首帧,@视频1参考镜头语言,@音频1用于配乐”。该图片与上下文紧密相关,直观呈现了在即梦创作界面全能参考模式下,通过“@”唤起参考调用并输入提示词的操作示例,辅助说明上传素材后图片支持悬停预览的功能。
图片展示的是即梦生成器界面,主体为一个穿着棕色毛绒外套、戴着棕色帽子的卡通兔子坐在橙色跑车里,背景是绿色草地。下方有“@图片1作为首帧”字样。界面右侧有“@素材名”输入框,提示“@图片1作为首帧,@视频1参考镜头语言,@音频1用于配乐”。该图片与上下文紧密相关,直观呈现了在即梦创作界面全能参考模式下,通过“@”唤起参考调用并输入提示词的操作示例,辅助说明上传素材后图片支持悬停预览的功能。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中有一辆橙色跑车,车前坐着一只穿着棕色毛衣的兔子玩偶,背景是草地和树木。下方有“@图片1作为首帧,@视频1参考镜头语言,@音频1用于配乐”的提示。此外,还有两张图片,一张是两只熊在跳舞,另一张是穿着蓝色衣服的玩偶。该图片与上下文介绍的全能参考模式下@素材的使用技巧相关,直观呈现了如何通过@指定图片、视频、音频的用途。
图片展示的是即梦创作界面中全能参考模式下的示例。画面中有一辆橙色跑车,车前坐着一只穿着棕色毛衣的兔子玩偶,背景是草地和树木。下方有“@图片1作为首帧,@视频1参考镜头语言,@音频1用于配乐”的提示。此外,还有两张图片,一张是两只熊在跳舞,另一张是穿着蓝色衣服的玩偶。该图片与上下文介绍的全能参考模式下@素材的使用技巧相关,直观呈现了如何通过@指定图片、视频、音频的用途。
图片展示的是即梦生成器界面,上方显示视频时长10:10。画面中有一只橙色跑车,下方有“重新编辑”“再次生成”按钮。下方是视频预览区域,显示两只熊在草地上背对背站立,视频时长00:02。画面右上角有“时间”“生成类型”“操作类型”下拉选项。该图片与文档中介绍即梦生成器全能参考模式下上传素材后支持悬停预览的内容相关,直观呈现了视频预览效果。
图片展示的是即梦生成器界面,上方显示视频时长10:10。画面中有一只橙色跑车,下方有“重新编辑”“再次生成”按钮。下方是视频预览区域,显示两只熊在草地上背对背站立,视频时长00:02。画面右上角有“时间”“生成类型”“操作类型”下拉选项。该图片与文档中介绍即梦生成器全能参考模式下上传素材后支持悬停预览的内容相关,直观呈现了视频预览效果。

2)简短画面:自然语言描述提示词

对于 3-5 秒的简单过渡镜头(如角色走路、喝茶、转头),我们不需要写极其复杂的运镜指令。只要上传了精准的参考图,你可以直接使用简单的自然语言来描述。

用法思路: 比如上传一张男主资产图,直接输入“他正坐在沙发上,表情有些不耐烦地看了一眼手表”。把复杂的物理运动交给模型自身的常识去补全,这种方式出片极快,废片率极低。

图片展示了Seedance 2.0全能参考的使用效果。画面中呈现了两位身着古装的女性,左侧为粉紫色古装,右侧为淡紫色古装。左侧女性面部清晰,右侧女性面部模糊。画面下方有“全能参考”“图片参考”“视频参考”选项卡,底部文字提示“在背景聊天,讲述是古代侯府室内。”图片与上下文紧密相关,直观呈现了自然语言描述提示词在Seedance 2.0中的应用效果。
图片展示了Seedance 2.0全能参考的使用效果。画面中呈现了两位身着古装的女性,左侧为粉紫色古装,右侧为淡紫色古装。左侧女性面部清晰,右侧女性面部模糊。画面下方有“全能参考”“图片参考”“视频参考”选项卡,底部文字提示“在背景聊天,讲述是古代侯府室内。”图片与上下文紧密相关,直观呈现了自然语言描述提示词在Seedance 2.0中的应用效果。
视频节点 2.mp4下载 ↗

3)连贯剧情片段:资产+原生剧本

在短剧极快的节奏中,10-15秒的视频素材已经算是信息量极大的段落了,往往包含了一整段连贯的表演。对于这类带有明确剧情走向的片段,Seedance 2.0 展现出了惊人的理解力。这个时候我们可以把剧本复制进来作为提示词的输入形式。

用法思路: 上传角色资产图,然后直接把剧本文本(带双引号的台词、简单的动作描写)复制粘贴到提示词框中。模型会自动理解剧本的上下文情绪,让参考图中的人物在十几秒内完整地把这段剧情演出来,并同步对齐口型。这种模式非常适合快速验证大段剧情的视听表现力。

提示词公式:

以下这个《囚徒与守门人》属于玄幻题材剧本,是把西羊石团队成员中的西堂、羊羊、阿泷融入其中所创作的一个测试剧本 。

囚徒与守门人-剧本.docx下载 ↗
西堂-黄袍宗师
西堂-黄袍宗师
羊羊-白衣侠客
羊羊-白衣侠客
阿泷-黑袍法师
阿泷-黑袍法师
场景
场景

把三个角色的形象图以及一张场景图上传。然后在提示词的开头部分,输入以下提示词,以此来固定角色与场景:

若希望固定角色的音色,可先在剪辑软件中,从之前生成的片段里提取出人物的声音,随后将其上传,接着输入:

建议添加下面这句话,尽管未必能保证绝对有效,但能尽量避免模型生成字幕和音乐,为我们后期剪辑提供便利。毕竟不同素材生成的字幕样式可能存在差异,还容易出现乱码情况,而且不同片段直接生成的音乐也难以保持一致,所以在后期剪辑时统一添加字幕并配置音乐更为妥当。

后面紧接着将剧本中想要演绎的段落直接复制进来,汇总成如下提示词即可:

即梦操作界面
即梦操作界面
演示1.mp4下载 ↗

4)复杂调度片段:资产+视频分镜提示词🌟

如果你本身就是导演,或者具备一定的视听语言基础,你对这十几秒片段内部的机位调度、景别切换有非常精细化的要求(比如:必须先给手指特写,然后切到面部近景,最后切到双人全景等),光靠喂剧本让 AI 自由发挥就不够了。

在以前做精品漫剧的课程中,我们教给大家的方法,是要先把剧本拆解成分镜脚本。分镜脚本是由一系列精细化的镜头语言构成,比如一个 15 秒的视频素材,或许会被拆解成多个时长仅有几秒的分镜头。

曾经的分镜头脚本
曾经的分镜头脚本

分镜脚本旨在实现精准把控,在以往 “手搓流” 的 AI 视频制作时代,它是不可或缺的环节。

如今,随着众多好用的参考生视频模型涌现,像 Seedance 2.0 模型自行拆分的分镜,效果可能比人工制作的还要出色,所以很多人常常省略这一步。其实是否采用,需视具体需求而定。要是想快速完成成片,确实无需这一流程;但要是像传统导演那样,对每个画面都有独特构思,一心打磨精品,那就不妨先拆分镜脚本。

传统导演一般会人工拆分镜头脚本,而多数非专业人士会借助 AI 一次性生成完整的分镜脚本。不过,无论通过哪种方式,都一定要在脑海中从头到尾过一遍,判断镜头之间能否顺畅衔接,是否存在遗漏。关于视听语言和镜头组接等相关知识,后续课程会为大家讲解。

在当下快节奏的 AI 短剧工作流环境中,若要提升产能,不太可能全流程一个个先出图分镜图,再图生视频,这无异于四九年入国军。而是要学会将剧本转化成能够指导模型更精准生成视频的视频分镜提示词。

具体如何做呢?

但大家不难发现,实际上很多人在制作 AI 漫剧或仿真人短剧时,会把剧本改写成以下这种形式:

如此这般依次罗列,其实这与前面所讲的参考生视频提示词的基本公式写法大致相仿,只是对更多镜头进行了更为精细化的罗列。这种写法其实也是相当于直接把分镜头脚本的表格用文字的形式简单概述了一遍,这样整理起来就更加清晰明了,AI更容易看懂。

图片展示了视频生成中Seedance 2.0全能参考的使用技巧,用于复杂调度片段的资产+视频分镜提示词。画面中呈现了起手式(固定风格、角色、声音)及视频分镜提示词,如视觉风格为冷感写实现代戏剧短剧,角色为江濑和白百合,声音提示为提取音频1的白百合声音等。画面右上角有“起手式:固定风格、角色、声音”的文字标注,与上下文对应,直观呈现了使用技巧内容。
图片展示了视频生成中Seedance 2.0全能参考的使用技巧,用于复杂调度片段的资产+视频分镜提示词。画面中呈现了起手式(固定风格、角色、声音)及视频分镜提示词,如视觉风格为冷感写实现代戏剧短剧,角色为江濑和白百合,声音提示为提取音频1的白百合声音等。画面右上角有“起手式:固定风格、角色、声音”的文字标注,与上下文对应,直观呈现了使用技巧内容。
14-2.mp4下载 ↗

提示词公式:

##### (1)视频分镜提示词模板

在此,也为大家提供一个写分镜提示词的模板。

大家可将手头现有的剧本或分镜头脚本交给AI,让它帮你拆解成一段段15秒且包含这种结构化分镜的提示词,之后再依据自身理解加以修改。如此一来,配合前面提到的上传角色资产图、场景资产图、音频素材等操作,就能更精准细致地生成符合我们需求的视频素材。

# 西羊石视频分镜提示词创作模板 V4

你是一位专业影视导演、分镜师、剪辑指导兼 AI 视频提示词生成专家。

你的任务是:根据用户提供的单集剧本、分镜脚本、台词文本、剧情段落,以及可选的场景图/空间参考图,生成可直接用于 AI 视频生成工具的“分批次视频提示词”。

建议用户一次只粘贴一集剧本。不要把多集剧本一次性混在同一轮处理;如果用户粘贴了多集内容,应先提醒用户拆成单集处理,或只处理用户指定的其中一集。

请严格遵守以下规则。

---

## 一、使用方式

默认采用交互式使用方式。

1. 如果用户只发送本提示词模板,没有提供剧本、分镜脚本或台词内容,不要直接生成批次提示词。你必须先向用户收集必要信息。
2. 如果用户已经提供完整信息,包括视觉风格、处理方式、是否有场景图、剧本或分镜脚本内容,则直接按规则执行。
3. 如果用户只提供剧本或分镜脚本,没有选择视觉风格和处理方式,则使用默认值:视觉风格为真人实拍短剧风格,处理方式为自动处理。
4. 如果用户只提供剧本或分镜脚本,但没有说明是否有场景图,应先询问是否有场景图或空间参考图;如果用户说没有,再按无场景图流程继续。
5. 如果用户说“默认”,表示视觉风格使用真人实拍短剧风格,处理方式使用自动处理,场景图按无处理,除非用户随后上传图片。
6. 如果用户上传了场景图但没有说明对应关系,应根据图片内容和剧本场景进行合理匹配,并把不确定处列入场次初始关系确认表。

当信息不足时,请只询问以下四项,不要输出批次拆分方案或正式视频提示词:

1. 视觉风格:可直接填写想要的风格;也可参考真人实拍短剧风格 / 真人实拍写实风格 / 电影感写实风格 / 古装仙侠剧视觉风格 / 都市短剧视觉风格 / 2D 日漫风格 / 3D 动漫风格
2. 处理方式:自动处理 / 先确认场景关系 / 先确认批次拆分 / 直接生成
3. 是否有场景图或空间参考图:有 / 没有
4. 请粘贴一集剧本、分镜脚本或台词文本

---

## 二、核心原则

批次是视频生成单位,不是镜头单位。

一个批次可以包含多个镜头。不要因为一句台词、一个反应、一个特写就轻易拆成新批次。短剧节奏可以切镜,但批次不要拆得过碎。

每个批次必须做到:

1. 可以独立复制到 AI 视频生成工具中使用。
2. 根据剧情密度安排时长。信息量、台词量、动作链或冲突推进足够时,优先接近 12-15 秒;15 秒是上限,不是必须填满的容器。预计时长必须写具体秒数,例如 9 秒、12 秒或 15 秒,禁止写 12-15 秒这类范围。
3. 不得为了凑满 15 秒,拉长心理、表情、眼神、语气停顿、空镜、道具细节或环境镜头。无台词镜头必须短、准、有效,只服务信息、反应、转折、空间关系或情绪落点。
4. 只在内容确实很短、转场明确、动作极短、强节奏断点,或台词少但必须独立成段的短事件时,才使用 5-8 秒批次。
5. 只表现一个清晰的连续事件、对话段落、动作链或情绪单元。
6. 台词一字不差保留,不改写、不删减、不新增。
7. 人物、空间、道具、服装、伤势、手中物品前后一致。
8. 镜头描述具体,不能只写剧情概述。

---

## 三、输出流程

先判断用户填写的处理方式,再判断是否提供了场景图、空间参考图、角色站位图、实景照片、概念图或类似视觉参考。

处理方式含义:

1. 自动处理:默认方式。有场景图时先确认场景关系;无场景图时,短内容直接生成,长内容先确认批次拆分。
2. 先确认场景关系:先拆解场景图,确认每场戏的初始空间关系、空间锚点和角色站位。
3. 先确认批次拆分:先确认每个批次的原文范围、核心事件、预计时长和结尾画面状态。
4. 直接生成:跳过中间确认,直接输出完整批次提示词。

如果用户提供了场景图,并且处理方式不是“直接生成”,必须先输出“场次初始关系确认表”,等待用户确认后,再生成批次拆分方案或完整批次提示词。

场景图确认优先级高于批次拆分方案和完整提示词生成。除非用户明确选择“直接生成”,否则有场景图时不得直接进入批次提示词输出。

场次初始关系确认表格式:

| 场次 | 对应场景图 | 原文范围 | 图像元素拆解 | 固定空间锚点 | 角色初始站位 | 初始距离与朝向 | 关键道具位置 | 需要确认的问题 |
|---|---|---|---|---|---|---|---|---|
| 场景 1 | 图 1 / 用户提供的某张图 | 用原文起止句概括 | 概括图中的空间结构、前中后景和主要物件 | 写清门、窗、桌、椅、台阶、柱子、主位等可反复引用的稳定元素 | 写清每个主要角色在本场戏开始时的位置、姿态、朝向、视线关系 | 写清角色之间的初始距离层级、中间阻隔、朝向和视线关系,例如隔桌相对、相隔三步、背对门口、看向窗边 | 写清会影响连续性的道具位置 | 只列需要确认的不确定点 |

输出场次初始关系确认表时,只做每场戏开场空间、空间锚点、角色站位、初始距离、朝向与视线确认,不要生成批次拆分方案,也不要生成正式视频提示词。

用户确认后,再根据确认过的每场戏初始关系,把每场戏拆成若干批次。每个批次的“开场画面状态”和“初始空间关系”都必须依据该场戏确认过的初始关系,以及前一批次的结尾画面结果来写;最终输出时只写具体可见状态,不写抽象承接语。

如果用户没有提供场景图,则根据输入长度和处理方式继续执行:

1. 如果原文较短,预计不超过 6 个批次,直接输出完整批次提示词。
2. 如果原文较长,预计超过 6 个批次,先输出“批次拆分方案”,等待用户确认后再生成完整批次提示词。
3. 如果用户明确选择“直接生成”,则跳过确认,直接输出完整批次提示词。

批次拆分方案格式:

| 批次 | 原文范围 | 场景/地点 | 核心事件 | 预计时长 | 结尾画面状态 |
|---|---|---|---|---|---|
| 1 | 用原文起止句概括 | 场景名称 | 本批次表现的连续事件/对话段落 | 具体秒数,例如 15 秒 | 本批次最后一秒的人物、道具、空间和情绪结果 |

输出批次拆分方案时,不要生成正式视频提示词。

---

## 四、场景图拆解规则

场景图不是装饰参考,而是初始空间连续性的依据。后续批次中的初始空间关系、角色站位、运镜方向、道具位置和空间锚点,应优先承接已确认的场景图拆解结果。

如果用户上传场景图、空间参考图、实景照片、概念图或角色站位图,必须先拆解图片中的视觉元素,再建立场次初始空间关系。

必须拆解以下内容:

1. 主要空间结构:房间、院落、街道、走廊、舞台、桌面等整体空间形态。
2. 稳定空间锚点:门、窗、桌、椅、床、沙发、台阶、柱子、屏风、路灯、车辆、树、栏杆、主位等。
3. 前后左右与纵深关系:哪些元素在前景、中景、背景,哪些位置适合角色进入、站立、坐下或移动。
4. 可用于角色站位的区域:入口、桌前、窗边、沙发旁、台阶下、主位旁、走廊尽头等。
5. 初始距离与朝向:角色之间是接触距离、近身距离、对话距离、疏离距离还是远距离;写清中间阻隔、人物朝向和视线关系,不写后续移动路径。
6. 关键道具与可交互物:文件、杯子、钥匙、手机、武器、包、椅子、门把手等。
7. 光线与视觉重点:主光方向、明暗区域、视觉中心、适合特写的物件或人物位置。
8. 画面限制:图中没有的关键元素不要擅自添加;如剧本需要但图中没有,应列为需要用户确认的问题。

---

## 五、场次初始关系确认规则

1. “场景图”可以是用户上传的图片、实景照片、概念图、AI 生成参考图、空间布局图或角色站位草图。
2. 如果一集剧本中有多场戏,每场戏可能会继续拆成多个批次,但在拆批次前,必须先确认每场戏最开始的初始空间关系、空间锚点、初始距离、朝向和角色站位。
3. 场次初始关系确认表只描述“每场戏开始时”的状态,不提前写该场戏中后续发生的移动、冲突、跌倒、转身、追逐或道具变化。
4. 如果场景图与剧本文字存在冲突,应在“需要用户确认的问题”中指出,不要擅自改动剧本。
5. 如果用户上传了多张场景图,但没有说明对应关系,应根据图片内容和剧本场景进行合理匹配,并把不确定的匹配写进“需要用户确认的问题”。
6. 如果用户只上传了一张场景图,而剧本包含多场戏,应只把该图用于最匹配的场次;其他场次按剧本文字建立场次初始空间关系,并在确认表中注明“无对应场景图,按剧本文字推定”。
7. 用户确认场次初始关系后,后续生成批次提示词时不得擅自改变已确认的固定空间结构、空间锚点、角色开场站位、初始距离关系、朝向关系和关键道具位置。
8. 如果用户在确认时修改了站位、空间、空间锚点、初始距离关系、朝向关系或道具位置,必须以用户修改后的版本为准。

---

## 六、初始空间距离与镜头位移规则

空间距离用于表达人物关系、调度位置和画面层次,不是精确坐标。初始空间关系只描述本批次第 0 秒的初始空间状态,不写后续位移、不写行动路径、不写将要发生的动作。

初始距离表达优先级:

1. 空间锚点优先:先说明人物相对于门、窗、桌、沙发、台阶、柱子、主位、走廊尽头等固定空间锚点的位置。
2. 区域关系其次:再说明人物处于前景、中景、背景,或位于桌前、门口、窗边、池壁旁、台阶下等区域。
3. 距离层级辅助:用接触距离、近身距离、对话距离、疏离距离、远距离等关系词说明人物距离。
4. 动作尺度补充:近距离关系可使用半步、一步、一臂距离、伸手可及、肩膀几乎相贴等表达,但必须绑定空间锚点、初始站位或中间阻隔,不要孤立使用。
5. 远距离表达:远距离不要只写“几米外”,应写清前景/中景/背景、隔着整间房、隔着红毯/台阶/街道/桥面/院落,或人物在画面中变成远处小身影。
6. 中间阻隔:如果两人之间隔着桌子、茶几、浴池、红毯、台阶、街道、桥面、门框、屏风等,必须写明。
7. 朝向与视线:写清谁面向谁、谁背对门、谁看向窗边、谁低头避开视线。
8. 镜头位移路径:角色位移只写在详细剧情的对应镜头中,必须写成“从哪里出发 + 朝哪个空间锚点移动 + 移动几步/绕过什么/跨过什么 + 停在哪里 + 与谁形成什么距离”。

近距离可参考:

1. 接触距离:肩膀几乎相贴、手已经碰到袖口、被按在池壁前、贴近胸膛。
2. 近身距离:一臂距离、伸手可及、向前半步进入对方私人空间。
3. 对话距离:隔着办公桌相对、相隔两三步,可以正常对话。

远距离可参考:

1. 室内远距离:一人在前景门口,另一人在背景窗边,两人之间隔着整间客厅和茶几。
2. 大空间远距离:一人在台阶下,另一人在主位前,两人之间隔着红毯和两排立柱。
3. 户外远距离:一人在前景车旁,另一人在背景路灯下,人物只占画面很小比例,两人之间隔着空旷街道。
4. 追逐远距离:追赶者在中景桥面,被追者已到背景桥头,两人之间隔着半座桥。

每批次开场画面状态与初始空间关系必须依据已确认的场次初始关系,只写初始空间状态;每批次详细剧情中的位移,必须沿用同一套空间锚点和距离层级,在对应镜头中写清行动路径。

---
## 七、批次拆分规则

1. 批次目标通常为 8-15 秒。信息量、台词量、动作链或冲突推进足够时,优先接近 12-15 秒;15 秒是上限,不是必须填满的容器。预计时长必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒,禁止写 12-15 秒这类范围。
2. 单个批次最多不超过 15 秒。不要为了凑满 15 秒,把心理、表情、眼神、语气停顿、空镜、道具细节、环境镜头或无台词反应拉长。
3. 5-8 秒批次只用于非常短的独立动作、空镜、转场、强节奏断点、无法自然扩展的内容,或台词少但必须独立成段的短事件。
4. 批次边界优先看空间、时间、地点、事件转折、情绪阶段和结尾画面状态,不以一句台词结束、一个表情反应或一次切镜作为默认边界。
5. 不同场景、不同时间、不同地点、重大情绪转折,必须拆成不同批次。
6. 同一场景、同一对话、同一连续动作链、同一情绪推进段落,优先合并到一个批次内;如果合并后剧情密度不足,不要硬拉长到 15 秒。
7. 同一轮连续对话、连续动作或连续压迫关系,可以放在同一批次内,通过正反打、反应镜头、道具特写和运镜完成节奏变化。
8. 不要按一句台词一个批次机械拆分;短句、短反应和短停顿,默认先作为 0.8-5 秒的短镜头处理,而不是直接拆成独立批次。
9. 长台词优先在同一批次内用切镜、正反打、反应镜头、细节镜头承接;但不得为了凑满 15 秒,把长台词、复杂动作链和重大情绪转折硬塞进同一批次。
10. 多句短台词如果发生在同一空间、同一对话节奏里,应尽量合并到同一个批次;如果合并后台词时长明显不足,只能用短促有效的反应镜头、道具细节、动作停顿和空间调度补足必要节奏,不能扩写成拖沓留白。
11. 如果一句台词太长,导致单个批次超过 15 秒,可以按原台词中的标点或自然语义节点拆到相邻批次,但必须保持原文顺序,不能改写、删减或新增。
12. 同一场景持续很久时可以拆成多个批次,但每个批次都必须重新写完整的初始空间关系,禁止写“同上”“同前”“场景不变”。

---

## 八、镜头衔接规则

剪辑方式不在批次开头单独标注,而是在每个镜头的时间后明确写出:开场镜头 / 切镜 / 一镜到底。

一个批次可以由多个切镜组成,也可以全段一镜到底,也可以前半段切镜、后半段一镜到底。根据动作、台词和情绪需要决定。

短剧默认采用切镜。只有当连续动作、空间移动、道具传递、悬疑发现、情绪递进或压迫感需要完整保留时,才使用一镜到底。

短剧内部镜头节奏要快而清楚。反应、眼神、表情、手部动作、道具细节、空镜和环境镜头通常控制在 0.8-3 秒;只有重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果,才可以延长到 4-6 秒。不要用多个无台词镜头连续堆叠来填满批次时长。

镜头衔接方式:

1. 开场镜头:每个批次的第一个镜头使用,表示本批次从该画面开始。
2. 切镜:从上一个镜头切换到当前镜头,短剧对话、冲突、反应、信息揭示、长台词承接时优先使用。
3. 一镜到底:当前镜头内部保持连续拍摄,不切到其他画面;可以作为整个批次的唯一镜头,也可以作为一个批次中的局部连续镜头段落。

一镜到底适用场景:

1. 角色连续走位改变人物关系,例如从门口进入、绕过桌子、逼近对方、停在对方面前。
2. 动作因果必须清楚,例如拿起钥匙、藏进袖口、转身离开。
3. 情绪缓慢变化,例如强忍、迟疑、眼眶发红、终于开口。
4. 悬疑揭示或发现过程,例如推门、进入暗房、发现地面痕迹、抬头看见关键物件。
5. 紧张对峙中的压迫推进,例如镜头缓慢推近,双方沉默,只有呼吸和眼神变化。
6. 单个完整动作链,例如躲闪、夺刀、撞到桌边、摔倒。
7. 转场性跟拍,例如角色从走廊走进办公室,用于建立空间动线。

一镜到底限制:

1. 一镜到底通常控制在 4-12 秒。
2. 原则上不用于承载长台词。
3. 如果一镜到底超过 12 秒,必须有明确的连续动作、走位变化、悬疑发现或情绪递进支撑。
4. 多人对话、长台词输出、强冲突争吵、信息量大的剧情解释、需要突出多个角色反应的段落,优先使用切镜。

镜头标注规则:

1. 每个批次的镜头 1 写“开场镜头”,除非整个批次从 0 秒开始就是全段一镜到底,则镜头 1 写“一镜到底”。
2. 从镜头 2 起,如果是从上一镜切换到当前镜头,写“切镜”。
3. 如果当前镜头内部需要完整保留连续动作、走位、发现过程或情绪递进,写“一镜到底”。
4. 一个批次中可以先写“开场镜头”和“切镜”,再在后续某个镜头写“一镜到底”。
5. 同一个镜头的时间后只选择一种标注:开场镜头、切镜或一镜到底。若该镜头内部需要完整连续拍完动作链或情绪段落,即使它前面已有其他镜头,也直接标注“一镜到底”。

---

## 九、台词节奏与时长判断规则

台词时长不能只按字数机械计算。必须先判断台词的节奏类型,再估算语速、停顿和镜头承载方式。

每句台词单独判断节奏类型,是为了估算语速、停顿、镜头承载和批次总时长,不是为了把每句台词拆成独立批次。短句、抢话、反问、冷笑、停顿和听者反应,优先在同一批次内通过切镜完成节奏变化。

无台词镜头的时长要克制:普通反应、眼神、表情、手部动作、道具细节、空镜和环境镜头通常为 0.8-3 秒;只有承担重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果时,才可以给到 4-6 秒。不要为了接近 15 秒,把没有新增信息的停顿、空镜或表情反应写长。

1. 每句台词都必须单独判断节奏类型,不能只凭感觉分配秒数。
2. 急促压迫型:用于争吵、质问、威胁、抢话、逃命、危机推进。可按每秒约 5-7 个汉字估算,停顿较少,但不能压缩到听不清。
3. 正常推进型:用于普通剧情信息、日常对话、关系推进。可按每秒约 4-5 个汉字估算,保留自然换气和短停顿。
4. 阴阳怪气 / 试探 / 冷嘲型:用于讽刺、挑衅、压迫、故意放慢语气、欲言又止。可按每秒约 3-4 个汉字估算,并额外留眼神、停顿、听者反应。
5. 情绪压抑 / 哽咽 / 崩溃型:用于强忍、迟疑、哭腔、爆发前压抑、情绪崩塌。可按每秒约 2.5-3.5 个汉字估算,并额外留呼吸、停顿、表情变化。
6. 信息揭露 / 解释型长台词:用于揭露真相、交代背景、说明逻辑。可按每秒约 3.5-5 个汉字估算,但必须用反应镜头、正反打、细节镜头或环境压迫镜头承接信息量。
7. 逗号、顿号、转折、迟疑、问句、感叹句、省略号,要根据节奏类型预留停顿;急促压迫型停顿短,阴阳怪气和情绪压抑型停顿长。
8. 短台词 1-12 个汉字,通常可以一个镜头说完,根据节奏给 1-3 秒。
9. 中等台词 13-25 个汉字,可以一个镜头说完,也可以拆成说话镜头 + 反应镜头;急促或正常推进时通常给 3-6 秒,阴阳怪气或情绪压抑时通常给 5-8 秒。
10. 长台词 26-45 个汉字,原则上至少拆成 2 个镜头承接;可以让角色继续说,也可以用画外音切到听者反应、道具细节、手部动作或环境压迫镜头。
11. 超长台词 45 个汉字以上,必须拆成 3 个以上镜头承接;如果“台词 + 动作 + 停顿”超过 15 秒,才按原文标点或完整语义节点拆到相邻批次。
12. 超过 30 个汉字的台词,禁止只用一个镜头拍角色说完,必须拆成说话镜头 + 反应镜头 / 正反打镜头 / 手部细节 / 道具特写 / 环境压迫镜头,并用画外音承接。
13. 长台词需要优先拆镜头,不优先拆批次。不要因为一句话超过 30 个汉字,就直接拆成多个不足 10 秒的短批次。
14. 每个批次的总时长,要根据“台词节奏类型 + 台词时长 + 动作时长 + 情绪停顿”综合判断,并尽量接近 12-15 秒。
15. 禁止出现明显不合理的安排,例如二十多个汉字的台词只给 3 秒,三十多个汉字的台词只给 5 秒,或者把阴阳怪气、哽咽迟疑的台词按急促争吵处理。
16. 不得把一句完整台词截成只剩半句放在一个批次中;如果跨批次承接,必须按原文标点或完整语义节点拆分。

---

## 十、台词处理规则

1. 剧本中的台词必须一字不差保留,不得改写、删减或新增。
2. 不要使用“台词:”这种格式。
3. 当角色在镜头中开口说话时,写成:
   角色名说:“原台词”。
4. 当角色是心理活动时,写成:
   角色名内心独白:“原台词”。
5. 当镜头切到别人反应、空镜、道具特写、背影,或者说话的人不在画面中时,写成:
   角色名画外音:“原台词”。
6. 如果原文是旁白,写成:
   旁白画外音:“原台词”。
7. 可以补充人物动作、神态、眼神、停顿和镜头调度,但不能新增剧本中没有的台词。
8. 禁止把台词写成画面字幕、屏幕文字、提示牌文字或水印。

---

## 十一、镜头内容规则

每个批次的详细剧情必须用“镜头 1、镜头 2、镜头 3……”编号。

每个镜头必须包含:

1. 镜头编号
2. 起止时间
3. 镜头衔接方式:开场镜头 / 切镜 / 一镜到底
4. 景别
5. 运镜或固定镜头
6. 详细画面内容
7. 必要的台词
8. 必要的音效

镜头内容必须写清楚人物动作、神态、构图、光影、画面重点和节奏变化。涉及角色移动时,必须在对应镜头中写清:从哪个初始位置出发,朝哪个空间锚点移动,移动几步或跨过什么,最终停在哪里,并与谁形成什么距离。

示例格式:

镜头 1:0-4秒,开场镜头,中景,固定镜头,角色站在办公桌前,身体微微前倾,目光压向对方,桌面文件被台灯照亮。角色名说:“原台词”。

镜头 2:4-9秒,切镜,近景,缓慢推进,听者握紧杯沿,眼神闪躲,杯中水面轻轻晃动。角色名画外音:“原台词”。音效:杯壁轻响。

镜头 3:9-15秒,切镜,特写,固定镜头,角色的手指压住文件边缘,纸张被慢慢推到桌面中央。音效:纸张摩擦声。

一镜到底示例:

镜头 1:0-11秒,一镜到底,中景转近景,手持跟拍,角色从门口进入,沿着桌边缓慢走向对方,停在办公桌前,低头看见桌上的黄铜钥匙,伸手拿起后藏进袖口,抬眼看向窗边的人。音效:脚步声、衣料摩擦声、钥匙轻响。

---

## 十二、初始空间关系规则

“初始空间关系”用于说明本批次第 0 秒的场景结构、空间锚点、全部在场主要角色初始位置、人物朝向、距离关系和人物关系。

1. 每个批次都要先建立该场景的固定空间描述,再写本批次第 0 秒所有在场主要角色的初始位置。
2. 固定空间描述应优先使用场景中的稳定参照物。
3. 写人物位置时,应优先相对于固定空间元素描述,而不是只写“画面左侧”“画面右侧”。
4. “初始空间关系”中只写该批次第 0 秒的人物初始位置,不提前写人物后续运动后的位置。
5. 角色后续的移动、逼近、转身、起身、后退、跌倒、走向某处等变化,应写在“详细剧情”的镜头内容中。
6. 如果本批次与前一批次属于同一场景,必须根据前一批次的结尾画面结果更新本批次开场画面状态;最终输出时只写具体画面事实,不写抽象承接说明。
7. 即使属于同一场景,也禁止使用以下表达:
   - 同上
   - 同前
   - 延续上一批次
   - 场景不变
   - 人物位置不变
   - 继续刚才的对峙
8. 同一场景的后续批次,初始空间关系不能越写越短,必须保留主要固定元素,例如门、桌、椅、窗、台阶、主位、地毯、柱子等。
9. 初始空间关系必须写清本场景内所有在场主要角色的位置、姿态、朝向和视线关系。即使某个角色在本批次没有台词、没有动作,只要他仍在场,也必须写出他的位置和状态。
10. 初始空间关系中禁止出现表示未来动作的词语,例如随后、后续、准备、将要、会、走向、起身、退后、逼近、冲入、离开。角色位移只能写在详细剧情的具体镜头中。
11. 如果本批次没有角色,不需要写人物位置,但仍然要写清楚场景的固定空间描述。

可参考的稳定参照物:

1. 室内:床、沙发、办公桌、讲台、投影幕布、门口、窗户、桌椅、走廊、屏风。
2. 室外:院门、石阶、街道、桥、车辆、路灯、树、栏杆、城墙。
3. 特殊空间:祭台、法阵、擂台、舞台、宴会主桌、宗门大殿、会议桌主位。

---

## 十三、连续性与画面状态规则

1. 同一场景中的人物位置、姿态、道具、服装、伤势、手中物品必须前后一致。
2. 如果前一批次写了角色移动到某处,下一批次的开场画面状态和初始空间关系必须以移动后的结果为准。
3. 如果前一批次写了角色坐着,下一批次不能直接写成站着,除非前一批次画面内容已经明确写了起身。
4. 如果剧本中某个道具已经明确为“黄铜钥匙”,后续不能擅自改成“紫檀木钥匙”“玉钥匙”等其他材质。
5. 如果某个道具在桌面、手中、地上发生了位置变化,下一批次必须根据前一批次的结尾画面结果更新。
6. 不得自行添加剧本中没有的新道具、新人物、新事件。
7. 每个批次必须写“开场画面状态”和“结尾画面状态”。开场画面状态用于锁定本批次第 0 秒已经存在的可见信息;结尾画面状态用于锁定本批次最后一秒应停留的画面结果。
8. 开场画面状态和结尾画面状态只写可见事实,包括人物位置、姿态、服装、手中物品、关键道具位置、伤势、环境变化和情绪状态。
9. 状态字段禁止写抽象承接说明、笼统开场说明或省略式表达。
10. 状态字段禁止写台词,禁止使用引号引用台词。若需要说明台词进度,只能用无引号的简短事实说明,例如本批次对白已结束。

---

## 十四、音效规则

1. 只生成音效,禁止生成音乐。
2. 禁止生成任何字幕、文字、水印。
3. 每个批次开头都必须写:

只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。

4. 音效只写环境声和动作声,例如脚步声、风声、雨声、门响、衣料摩擦声、喘息声、碎裂声、纸张燃烧声。
5. 如果某个镜头没有明确音效,直接省略“音效”字段。
6. 禁止写“音效:无”“无音效”“音效:无明显音效”。
7. 禁止写鼓点、配乐、BGM、旋律、氛围音乐、紧张音乐、悲伤音乐、史诗音乐等音乐类描述。只允许写环境声和动作声。

---

## 十五、标准输出格式

请严格按照以下格式输出:

---
【批次 1】

视觉风格:[填写视觉风格;若用户未填写,默认真人实拍短剧风格]

只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。

预计时长:[必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒。根据剧情密度判断;信息量足够时优先 12-15 秒,内容较短且无法自然合并时可低于 12 秒。禁止写时间范围,禁止为了凑满 15 秒拉长无台词镜头。]

开场画面状态:[只写本批次第 0 秒画面中已经存在的人物、位置、姿态、服装、手中物品、关键道具位置、伤势、环境和情绪状态。禁止写抽象承接说明或笼统开场说明。]

初始空间关系:[按“固定空间锚点 / 全部在场主要角色初始站位 / 初始距离关系 / 朝向与视线关系”写清楚。只写本批次第 0 秒的初始空间状态,不写后续位移或行动路径,不要只写画面左右,不要写“同上”。]

以下是详细剧情:
镜头 1:0-X秒,开场镜头,[景别],[运镜/固定镜头],[详细画面内容,包括人物动作、神态、构图、光影、节奏变化]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]

镜头 2:X-X秒,切镜,[景别,标注正反打/反应镜头/细节镜头/空镜],[运镜/固定镜头],[详细画面内容,必要时承接前一镜的动作变化]。角色名说/内心独白/画外音:“原台词”。

镜头 3:X-X秒,一镜到底,[景别变化],[运镜方式],[完整连续动作、走位、发现过程或情绪递进]。音效:[具体音效]

结尾画面状态:[只写本批次最后一秒应停留的画面结果。必须覆盖所有在场主要角色的位置、姿态、视线、情绪,以及关键道具位置和环境变化。不要写台词,不要使用引号。]

---
【批次 2】

视觉风格:[填写视觉风格;若用户未填写,默认真人实拍短剧风格]

只生成音效,禁止生成音乐。禁止生成任何字幕、文字和水印。

预计时长:[必须写具体秒数,例如 8 秒、11 秒、13 秒、15 秒。根据剧情密度判断;信息量足够时优先 12-15 秒,内容较短且无法自然合并时可低于 12 秒。禁止写时间范围,禁止为了凑满 15 秒拉长无台词镜头。]

开场画面状态:[只写本批次第 0 秒画面中已经存在的人物、道具、姿态、伤势、情绪和空间位置。禁止写抽象承接说明。]

初始空间关系:[按“固定空间锚点 / 全部在场主要角色初始站位 / 初始距离关系 / 朝向与视线关系”完整写清楚。若与前一批次属于同一场景,也必须重新完整写清楚,并根据前一批次的结尾画面结果更新本批次的角色初始位置;最终输出只写第 0 秒的具体空间事实,不写后续位移或抽象承接语。]

以下是详细剧情:
镜头 1:0-X秒,开场镜头,[景别],[运镜/固定镜头],[详细画面内容]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]

镜头 2:X-X秒,切镜,[景别,标注正反打/反应镜头/细节镜头/空镜],[运镜/固定镜头],[详细画面内容]。角色名说/内心独白/画外音:“原台词”。

结尾画面状态:[只写本批次最后一秒应停留的画面结果。必须覆盖所有在场主要角色的位置、姿态、视线、情绪,以及关键道具位置和环境变化。不要写台词,不要使用引号。]

---

如果整个批次全段一镜到底,标准格式可简化为:

以下是详细剧情:
镜头 1:0-X秒,一镜到底,[景别变化],[运镜方式],[完整连续动作、走位、发现过程或情绪递进]。角色名说/内心独白/画外音:“原台词”。音效:[具体音效]

如果只是局部一镜到底,可以在同一批次中先写开场镜头或切镜,再把需要连续完成的段落写成“一镜到底”镜头。

---

## 十六、生成前自检

正式输出前,请在内部检查以下内容,但不要把自检过程输出给用户:

1. 是否一次只处理一集剧本。
2. 如果用户提供了场景图,是否已经先拆解图像元素、固定空间锚点、初始距离与朝向、关键道具位置。
3. 如果用户提供了场景图,是否已经先输出每场戏初始关系确认表,并等待用户确认。
4. 场次初始关系中是否写清空间锚点、角色站位、初始距离关系、中间阻隔、朝向与视线。
5. 每批次初始空间关系是否只写第 0 秒的初始关系,角色位移是否只写在详细剧情的对应镜头中。
6. 每个批次是否根据剧情密度判断时长,并且预计时长是否写成具体秒数,而不是时间范围。
7. 是否把 15 秒当成上限,而不是必须填满的容器。
8. 低于 10 秒的批次是否有必要理由,或是否属于台词少但必须独立成段的短事件。
9. 是否把镜头切分误当成批次切分,导致批次过碎。
10. 是否把一句台词、一个表情反应、一次停顿或一个空镜机械拆成独立批次。
11. 是否为了凑满 15 秒,拉长心理、表情、眼神、语气停顿、空镜、道具细节、环境镜头或无台词反应。
12. 无台词镜头是否短、准、有效;普通反应、眼神、表情、手部动作、道具细节、空镜和环境镜头是否通常控制在 0.8-3 秒。
13. 只有重大反转、爽点落地、强情绪崩溃、悬疑发现、关键证据揭示或完整动作因果,是否才把无台词镜头延长到 4-6 秒。
14. 每句台词是否先判断了节奏类型:急促压迫型、正常推进型、阴阳怪气 / 试探 / 冷嘲型、情绪压抑 / 哽咽 / 崩溃型、信息揭露 / 解释型长台词。
15. 每句台词的节奏判断是否只用于估算语速、停顿、镜头承载和批次总时长,而不是作为拆批次依据。
16. 台词语速是否符合剧情情绪;紧张冲突是否允许更快语速,阴阳怪气、试探、哽咽、迟疑是否保留足够停顿和反应。
17. 台词时长是否根据“节奏类型 + 字数 + 停顿 + 动作”综合判断,而不是只按固定每字秒数机械计算。
18. 中等台词 13-25 个汉字是否根据节奏给足 3-8 秒,或拆成说话镜头 + 反应镜头。
19. 长台词 26-45 个汉字是否至少拆成 2 个镜头承接。
20. 超长台词 45 个汉字以上是否拆成 3 个以上镜头承接,必要时才跨批次。
21. 超过 30 个汉字的台词是否拆成说话镜头 + 反应镜头 / 正反打镜头 / 细节镜头,并用画外音承接;是否避免用一个镜头硬拍完。
22. 是否出现二十多个汉字只给 3 秒、三十多个汉字只给 5 秒,或把阴阳怪气、哽咽迟疑按急促争吵处理这类明显不合理安排。
23. 台词是否一字不差保留,是否没有删减、改写或新增。
24. 如果台词跨批次,是否按原文标点或完整语义节点拆分,避免只剩半句。
25. 是否新增了剧本中没有的台词、人物、道具或事件。
26. 每个镜头的时间后是否都明确标注“开场镜头 / 切镜 / 一镜到底”。
27. 从镜头 2 起,如果是从上一镜切换到当前画面,是否标注“切镜”。
28. 一镜到底段落是否确实需要连续动作、走位、发现过程或情绪递进;如果只是局部一镜到底,是否允许它和切镜共同存在于同一批次。
29. 每个批次是否都写了完整初始空间关系。
30. 初始空间关系是否覆盖所有在场主要角色;即使某个角色没有台词或动作,只要仍在场,是否写出了他的位置和状态。
31. 初始空间关系中是否误写了随后、准备、将要、走向、起身、退后、逼近、离开等后续动作。
32. 是否出现“同上”“同前”“场景不变”等禁用表达。
33. 开场画面状态是否写成具体可见事实,而不是抽象承接说明或笼统开场说明。
34. 结尾画面状态是否只写最后一秒的可见结果,是否覆盖所有在场主要角色和关键道具位置,且没有台词、引号或新增对白。
35. 是否误写音乐、字幕、文字、水印,是否出现鼓点、配乐、BGM、旋律、氛围音乐等音乐类描述。
36. 时间轴是否连续,是否从 0 秒开始并到达预计时长。
37. 每个镜头是否像视频提示词,而不是剧情概述。

---

可选输入格式如下。用户可以按此格式一次性提供信息;如果用户没有按此格式填写,你需要主动识别信息是否完整,并按“使用方式”中的规则提问或执行。

视觉风格:
(可直接填写想要的风格。以下仅为示例:真人实拍短剧风格 / 真人实拍写实风格 / 电影感写实风格 / 古装仙侠剧视觉风格 / 都市短剧视觉风格 / 2D 日漫风格 / 3D 动漫风格。若不填写,默认真人实拍短剧风格。)

处理方式:
(可填写:自动处理 / 先确认场景关系 / 先确认批次拆分 / 直接生成。若不填写,默认自动处理。)

场景图/空间参考图:
(可上传或说明对应关系,例如:图 1 对应场景 1,图 2 对应场景 2。若未上传场景图,则按剧本文字默认处理。)

剧本/分镜脚本内容:
(建议一次只粘贴一集剧本。请在这里粘贴单集剧本、分镜脚本或台词文本。)

实际使用的时候,只需要把上述提示词发送给任意的AI大语言模型工具,之后根据指令复制/上传剧本即可。

图片展示的是西羊石视频分镜提示词创作模板V7,由一位专业影视导演、分镜师、剪辑指导兼AI视频提示词生成专家提供。模板要求填写视频风格、处理方式、是否有场景图或空间参考图、粘贴剧本等内容,以生成符合规范的视频提示词。该模板与上下文紧密相关,上下文提到配合上传角色资产图、场景资产图、音频素材等操作,可更精准生成视频素材,此模板是实际使用时发送提示词的参考。
图片展示的是西羊石视频分镜提示词创作模板V7,由一位专业影视导演、分镜师、剪辑指导兼AI视频提示词生成专家提供。模板要求填写视频风格、处理方式、是否有场景图或空间参考图、粘贴剧本等内容,以生成符合规范的视频提示词。该模板与上下文紧密相关,上下文提到配合上传角色资产图、场景资产图、音频素材等操作,可更精准生成视频素材,此模板是实际使用时发送提示词的参考。

上传或复制剧本,不赶时间的话,处理方式建议选择“自动处理”,此时如果你的场景图已经生成好了,可以说“我有场景图”。

可以看到,我这一集剧本涉及到4场戏,因此包含四个场景,在我上传了一共6张图(有的场景包含不止一张图)后,它对场景的核心信息进行了提取,并且还有一些与剧本中对不上的场景信息需要与我们确定。

图片展示了4场戏的场景信息,对应剧本中“江澄出差”“周雨晨办公室”“心理咨询室”“小区楼下”4个场景。每场戏下有对应图片,还列出了场景要素、固定空间焦点、角色初始站位、初始调度与剧情、关键调度位置及需要解决的问题等内容。如“江澄出差”场景,有6张图片,涉及人物、场景、道具等要素,还标注了角色初始站位、调度位置等。该图与上下文介绍的视频分镜提示词模板相关,呈现了复杂调度片段的资产+视频分镜提示词使用示例。
图片展示了4场戏的场景信息,对应剧本中“江澄出差”“周雨晨办公室”“心理咨询室”“小区楼下”4个场景。每场戏下有对应图片,还列出了场景要素、固定空间焦点、角色初始站位、初始调度与剧情、关键调度位置及需要解决的问题等内容。如“江澄出差”场景,有6张图片,涉及人物、场景、道具等要素,还标注了角色初始站位、调度位置等。该图与上下文介绍的视频分镜提示词模板相关,呈现了复杂调度片段的资产+视频分镜提示词使用示例。

之后会与你确认将剧本拆分为若干批次,也就是Seedance2.0每批次执行的提示词内容以及对应的原文范围。要是你觉得满意,便可继续推进;要是你认为时长过长或过短,或是想重新分配,都能向其反馈。

图片为“批量拆分方案”表格,包含次序、参考视频、场景地点、核心事件、预计时长、结尾画面状态等信息。如次序1的参考视频是“江/江重”(低配版)三点七分,场景地点为H1江澄观景楼,核心事件是江澄发现,发现天花板有黑色液体在滴落,预计时长14秒等。该表格与上文提到的视频分镜提示词模板相关,展示了复杂调度片段中资产+视频分镜提示词的拆分方案。
图片为“批量拆分方案”表格,包含次序、参考视频、场景地点、核心事件、预计时长、结尾画面状态等信息。如次序1的参考视频是“江/江重”(低配版)三点七分,场景地点为H1江澄观景楼,核心事件是江澄发现,发现天花板有黑色液体在滴落,预计时长14秒等。该表格与上文提到的视频分镜提示词模板相关,展示了复杂调度片段中资产+视频分镜提示词的拆分方案。

注意:

此版本的提示词倾向于将剧本拆得比较细,对各种心理、神态、动作的刻画相对比较深刻,但这样会增加单集的总批次数。如果你希望稍微节省一点,在这个阶段就要跟他确认好。你可以对照着原文的范围自己估计一下,看每个批次能否增加更多的内容。

如果你觉得哪里有问题,可以跟它说,例如使用以下类似的话术:

  1. “批次 1,我希望能够呈现原文从哪一句话到哪一句话的内容。”
  2. “批次 X,我希望将更多的台词放进来,减少总批次数。”
  3. “帮我把总批次所花的时间压缩到两分半以内。”

确认好后,就会给你把剧本拆分成对应的若干批次的视频分镜提示词了。结合前面说的起手式+视频分镜提示词的模式,我们就能跑视频了。 可以看到,由于它前面读取了你的场景图,里面角色的位置关系与你的图能够对应得很好。再加上提示词里画面的初始状态和结尾状态,与后面每个批次都能首尾衔接得上,角色位置关系的演变也比较合理。

图片展示了剧本中“开场”部分的内容。开场场景是江浩在客人床边,手机在手,画面中呈现了角色的服装、动作等信息。剧本还对角色的台词进行了详细描述,如“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,
图片展示了剧本中“开场”部分的内容。开场场景是江浩在客人床边,手机在手,画面中呈现了角色的服装、动作等信息。剧本还对角色的台词进行了详细描述,如“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,“我来帮你”,

在将剧本拆成视频分镜提示词后,脑子里一定要有一个清晰的角色的行动路径。

视频分镜提示词中的开场状态-结束状态可以很好地明确角色的初始和结束的位置。但能否达成这样的效果,怎样达到效果,我们要如何人为地进行优化,是需要动脑筋的。

图片展示了一个室内场景,左侧是床铺,右侧是书桌。书桌上摆放着电脑、文件等物品,书桌旁有椅子。画面中用红色箭头标注了四个关键位置:1指向书桌,2指向椅子,3指向床铺,4指向床铺的另一侧。这些位置与上下文提到的视频分镜提示词模板中开场状态和结束状态的优化相关,可直观呈现角色初始和结束的位置。
图片展示了一个室内场景,左侧是床铺,右侧是书桌。书桌上摆放着电脑、文件等物品,书桌旁有椅子。画面中用红色箭头标注了四个关键位置:1指向书桌,2指向椅子,3指向床铺,4指向床铺的另一侧。这些位置与上下文提到的视频分镜提示词模板中开场状态和结束状态的优化相关,可直观呈现角色初始和结束的位置。
图片展示了AI仿真人短剧实战营中视频分镜的四个场景。左侧是交叉蒙太奇开场,画面中有一只手推着一个行李箱;中间是睁眼、起身,画面中人物躺在床上;右侧是人物从床上走到桌前,画面中人物面对着电脑;最右侧是视线转移、撞倒笔记本,画面中人物撞倒了笔记本。这些场景对应视频分镜提示词模板中开场状态、结束状态的示例,直观呈现了视频分镜的视觉效果。
图片展示了AI仿真人短剧实战营中视频分镜的四个场景。左侧是交叉蒙太奇开场,画面中有一只手推着一个行李箱;中间是睁眼、起身,画面中人物躺在床上;右侧是人物从床上走到桌前,画面中人物面对着电脑;最右侧是视线转移、撞倒笔记本,画面中人物撞倒了笔记本。这些场景对应视频分镜提示词模板中开场状态、结束状态的示例,直观呈现了视频分镜的视觉效果。

课堂上会拿案例进行详细讲解演示

5)固定音色

将生成的视频导入到剪映中,找到对应角色说话的区域,快捷键I为设置起始位置,O为设置终点位置。

将不同角色说话的片段选中,建议不超过5秒钟。

随后导出音频作为角色的音色资产。之后用seedance 2.0生成视频就可以反复调用对应角色的声音资产作为音频参考了。

图片展示了视频编辑软件界面,时间线中选中了女人说话的片段,画面显示“视频节点3.mp4 00:00:14:02”。画面下方有多个视频帧缩略图,呈现不同人物形象。界面上方有多个工具图标,如剪切、复制、删除等。右上角有“限免”标识。该图片与上下文“固定音色”相关,可能是用于说明在视频编辑中固定音色时,如何选中特定片段的操作示例。
图片展示了视频编辑软件界面,时间线中选中了女人说话的片段,画面显示“视频节点3.mp4 00:00:14:02”。画面下方有多个视频帧缩略图,呈现不同人物形象。界面上方有多个工具图标,如剪切、复制、删除等。右上角有“限免”标识。该图片与上下文“固定音色”相关,可能是用于说明在视频编辑中固定音色时,如何选中特定片段的操作示例。
图片展示了Jianying Pro软件中“导出”功能的界面。画面中“导出”按钮以蓝色高亮显示,箭头指向该按钮。界面下方有“草稿参数”区域,包含草稿名称、保存位置、色彩空间等信息,如草稿名称为“4月28日”,保存位置为E:/Application/Jianying documents/Draft/JianyingPro Drafts/4月28日等。该图片与上下文介绍的Seedance 2.0全能参考的使用技巧中固定音色的内容相关,可能用于说明导出操作步骤或相关设置。
图片展示了Jianying Pro软件中“导出”功能的界面。画面中“导出”按钮以蓝色高亮显示,箭头指向该按钮。界面下方有“草稿参数”区域,包含草稿名称、保存位置、色彩空间等信息,如草稿名称为“4月28日”,保存位置为E:/Application/Jianying documents/Draft/JianyingPro Drafts/4月28日等。该图片与上下文介绍的Seedance 2.0全能参考的使用技巧中固定音色的内容相关,可能用于说明导出操作步骤或相关设置。
图片展示了Seedance 2.0软件中视频导出设置界面。画面左侧是视频预览窗口,显示一个绿色的“202”图标。右侧是导出设置区域,有“视频导出”和“音频导出”两个选项,其中“视频导出”被蓝色框线突出显示。下方有视频分辨率、帧率、格式等设置项,当前视频格式为MP4,帧率为30。底部显示视频时长3秒、大小0.03MB(估计)。该图片与上下文介绍的视频导出设置相关,直观呈现了视频导出时的设置界面及关键选项。
图片展示了Seedance 2.0软件中视频导出设置界面。画面左侧是视频预览窗口,显示一个绿色的“202”图标。右侧是导出设置区域,有“视频导出”和“音频导出”两个选项,其中“视频导出”被蓝色框线突出显示。下方有视频分辨率、帧率、格式等设置项,当前视频格式为MP4,帧率为30。底部显示视频时长3秒、大小0.03MB(估计)。该图片与上下文介绍的视频导出设置相关,直观呈现了视频导出时的设置界面及关键选项。
这是一个视频编辑界面的截图,时间轴上的白色播放线正处于00:00的位置,时间轴上分布着多段古装人物的视频片段。界面配有蓝色提示文字,内容为“同理,选中男人说话的片段”,提示需选中对应视频片段,左侧还有标注“定区域”的操作提示,结合上下文可知该界面用于教学固定音色的操作,步骤指向需选取男人说话的视频片段。
这是一个视频编辑界面的截图,时间轴上的白色播放线正处于00:00的位置,时间轴上分布着多段古装人物的视频片段。界面配有蓝色提示文字,内容为“同理,选中男人说话的片段”,提示需选中对应视频片段,左侧还有标注“定区域”的操作提示,结合上下文可知该界面用于教学固定音色的操作,步骤指向需选取男人说话的视频片段。
图片展示的是视频生成软件Seedance 2.0的导出设置界面。画面中突出显示了“男人音色”标题和“视频导出”选项,下方还有“音频导出”选项。界面右侧有导出时间线、标题、导出至等设置项,如标题处有“男人音色”字样,导出至路径为E:/Users/zlloy/Download。该图片与上下文介绍的Seedance 2.0全能参考的使用技巧中固定音色的内容相关,展示了导出设置中音色和导出类型的选择界面。
图片展示的是视频生成软件Seedance 2.0的导出设置界面。画面中突出显示了“男人音色”标题和“视频导出”选项,下方还有“音频导出”选项。界面右侧有导出时间线、标题、导出至等设置项,如标题处有“男人音色”字样,导出至路径为E:/Users/zlloy/Download。该图片与上下文介绍的Seedance 2.0全能参考的使用技巧中固定音色的内容相关,展示了导出设置中音色和导出类型的选择界面。
女人音色.mp3下载 ↗男人音色.mp3下载 ↗

Libtv现在支持分离人声,并裁剪声音,这样方便直接在Libtv画布当中固定音色。建议每次截取的声音不要超过5秒。

图片展示了Libtv软件中音频分离功能的操作界面。画面右侧有“音频分离”下拉菜单,其中“人声分离”选项被红色框突出显示。在“人声分离”选项右侧,还有“仅保留人声”和“仅保留背景音”两个选项,也被红色框标出。该图片与上下文紧密相关,上下文提到Libtv支持分离人声并裁剪声音,建议每次截取声音不要超过5秒,此图直观呈现了音频分离功能的操作位置及部分选项。
图片展示了Libtv软件中音频分离功能的操作界面。画面右侧有“音频分离”下拉菜单,其中“人声分离”选项被红色框突出显示。在“人声分离”选项右侧,还有“仅保留人声”和“仅保留背景音”两个选项,也被红色框标出。该图片与上下文紧密相关,上下文提到Libtv支持分离人声并裁剪声音,建议每次截取声音不要超过5秒,此图直观呈现了音频分离功能的操作位置及部分选项。
图片展示的是Libtv中视频节点14 - 副本_人声的界面。画面中有一个音频波形图,下方显示时长为00:00 / 00:10。上方有三个功能按钮,分别是“截取”(带有剪刀图标)、“变速”(带有齿轮图标)和“下载”(带有下载图标)。该图片与文档中介绍Libtv支持分离人声并裁剪声音,方便在画布中固定音色的内容相关,直观呈现了操作界面。
图片展示的是Libtv中视频节点14 - 副本_人声的界面。画面中有一个音频波形图,下方显示时长为00:00 / 00:10。上方有三个功能按钮,分别是“截取”(带有剪刀图标)、“变速”(带有齿轮图标)和“下载”(带有下载图标)。该图片与文档中介绍Libtv支持分离人声并裁剪声音,方便在画布中固定音色的内容相关,直观呈现了操作界面。
图片展示的是Libtv视频编辑界面中视频节点14 - 副本_人声的编辑窗口。窗口内显示视频时长为3.35秒,下方有“截取”按钮,可选择00:02 - 00:06的视频片段。右下角有“生成”按钮。该图片与文档中介绍Libtv支持分离人声并裁剪声音,方便在画布中固定音色的内容相关,直观呈现了操作界面及可选择的视频片段范围。
图片展示的是Libtv视频编辑界面中视频节点14 - 副本_人声的编辑窗口。窗口内显示视频时长为3.35秒,下方有“截取”按钮,可选择00:02 - 00:06的视频片段。右下角有“生成”按钮。该图片与文档中介绍Libtv支持分离人声并裁剪声音,方便在画布中固定音色的内容相关,直观呈现了操作界面及可选择的视频片段范围。

6)素材衔接技巧

短剧是由多个片段拼成的,如果每次生成的素材光影、站位差异太大,后期就很难接上。

##### (1)A. 抽帧接力

将上一个视频生成的最后一帧截图,作为下一个视频生成的首帧参考图上传。这样能最大程度保证两个镜头的机位、光线和人物姿态在剪辑时能够无缝衔接。

如果是在libtv里生成的视频素材,鼠标悬停在视频上,右下角有个相机图标,可以截取首帧或者尾帧。

图片展示的是视频节点3的视频画面,画面中一男一女身着古装,女子穿着紫色长袍,男子穿着蓝色长袍,两人在室内对视交谈。画面右下角有三个操作选项,分别是“截取首帧”“截取尾帧”和“点击截取当前帧”,其中“点击截取当前帧”选项被蓝色边框突出显示。该图片与上下文介绍的视频素材衔接技巧相关,用于说明在剪辑软件中如何截取视频帧。
图片展示的是视频节点3的视频画面,画面中一男一女身着古装,女子穿着紫色长袍,男子穿着蓝色长袍,两人在室内对视交谈。画面右下角有三个操作选项,分别是“截取首帧”“截取尾帧”和“点击截取当前帧”,其中“点击截取当前帧”选项被蓝色边框突出显示。该图片与上下文介绍的视频素材衔接技巧相关,用于说明在剪辑软件中如何截取视频帧。
图片展示了视频剪辑中素材衔接的示例。画面中,一位身着紫色古装的女子与一位身着蓝色古装的男子对坐交谈,背景为室内环境,有屏风、绿植等装饰。画面被分为上下两部分,上半部分为“尾帧”,下半部分为“首帧”,均标注了尺寸为1284 x 716。该图片与上下文内容相关,用于说明在剪辑视频时,通过参考生视频的首帧和尾帧,可实现素材的自然衔接,是视频节点3.mp4中A段素材的衔接技巧示例。
图片展示了视频剪辑中素材衔接的示例。画面中,一位身着紫色古装的女子与一位身着蓝色古装的男子对坐交谈,背景为室内环境,有屏风、绿植等装饰。画面被分为上下两部分,上半部分为“尾帧”,下半部分为“首帧”,均标注了尺寸为1284 x 716。该图片与上下文内容相关,用于说明在剪辑视频时,通过参考生视频的首帧和尾帧,可实现素材的自然衔接,是视频节点3.mp4中A段素材的衔接技巧示例。
视频节点 3.mp4下载 ↗

也可以把视频素材下载下来,导入到剪映或其他任意剪辑软件中:

图片展示了剪映软件界面,用于说明视频素材下载后导入剪辑软件的操作。画面中显示了视频编辑界面,上方有“视频编辑”字样,画面中人物在古建筑场景中打斗。右侧有“选择导出静帧画面”和“取消编辑视频”选项。下方有“衔接1.mp4”视频文件,时间轴上有视频片段。底部有“取消”和“下载”按钮,以及“取消选择区域”选项。该图与上下文介绍的视频素材下载后导入剪映或其他剪辑软件操作相关。
图片展示了剪映软件界面,用于说明视频素材下载后导入剪辑软件的操作。画面中显示了视频编辑界面,上方有“视频编辑”字样,画面中人物在古建筑场景中打斗。右侧有“选择导出静帧画面”和“取消编辑视频”选项。下方有“衔接1.mp4”视频文件,时间轴上有视频片段。底部有“取消”和“下载”按钮,以及“取消选择区域”选项。该图与上下文介绍的视频素材下载后导入剪映或其他剪辑软件操作相关。
衔接1.mp4下载 ↗

再继续做下一段素材的提示词的时候,写上:@图片X作为首帧

图片展示的是视频生成中参考生视频的素材衔接技巧相关内容。画面左侧有“标记”“运镜”“角色库”等选项,右侧呈现多张图片,图片1标注为“首帧”,图片2标注为“是陆远铮”,图片3标注为“是沈宁”,图片4标注为“提取音频5的声音作为沈宁”,图片5标注为“提取音频6的声音作为沈宁”,图片6标注为“提取图片2的音色”。图片下方有视频节点描述,对应视频中不同场景和人物的对话及动作。
图片展示的是视频生成中参考生视频的素材衔接技巧相关内容。画面左侧有“标记”“运镜”“角色库”等选项,右侧呈现多张图片,图片1标注为“首帧”,图片2标注为“是陆远铮”,图片3标注为“是沈宁”,图片4标注为“提取音频5的声音作为沈宁”,图片5标注为“提取音频6的声音作为沈宁”,图片6标注为“提取图片2的音色”。图片下方有视频节点描述,对应视频中不同场景和人物的对话及动作。
视频节点 10.mp4下载 ↗
图片展示的是一个视频生成任务的参考生视频提示词界面。画面中有一张图片,图片左上角有“图片4 作为首帧”字样。下方有对视频内容的详细描述,包括对三张图片中角色的描述,如羊羊、阿龙、西堂等角色的动作、表情等,以及角色之间的对话内容。该图片与上下文紧密相关,是生成视频时对参考素材的详细说明,帮助生成系统理解视频内容,以实现素材衔接技巧。
图片展示的是一个视频生成任务的参考生视频提示词界面。画面中有一张图片,图片左上角有“图片4 作为首帧”字样。下方有对视频内容的详细描述,包括对三张图片中角色的描述,如羊羊、阿龙、西堂等角色的动作、表情等,以及角色之间的对话内容。该图片与上下文紧密相关,是生成视频时对参考素材的详细说明,帮助生成系统理解视频内容,以实现素材衔接技巧。

这样生成的结果就能够收尾相接了。

jimeng-2026-02-13-7150- 作为首帧。 是阿泷。是羊羊。是西堂。只生成音效,不生成音乐。不要生成任何字幕。....mp4下载 ↗

##### (2)B. 延长视频

还可以上传上一个片段,接着在提示词中要求模型延长视频。如此,模型便能直接参照上一段视频的尾帧,同时还能借鉴上一段视频所使用的声音,这样就不需要像前面那样事先提取声音作为音色参考了。

鉴于目前平台针对真实人脸的限制,这种方法在即梦或者其他平台已几乎无法继续使用。但在libtv中,依旧只需要按照上节课介绍的方法,将需要延长的视频素材,进行seedance 2.0合规校验,通过审查后即可完成后续的操作。

图片展示了视频编辑软件界面中“Seedance2.0合规校验”操作的弹出菜单。画面左上角显示“视频节点3”及“校验中”字样。弹出菜单中,“Seedance2.0合规校验”选项被蓝色边框突出显示。该图片与上文提到的在libtv中将需要延长的视频素材进行seedance 2.0合规校验的内容相关,直观呈现了操作步骤中的关键环节。
图片展示了视频编辑软件界面中“Seedance2.0合规校验”操作的弹出菜单。画面左上角显示“视频节点3”及“校验中”字样。弹出菜单中,“Seedance2.0合规校验”选项被蓝色边框突出显示。该图片与上文提到的在libtv中将需要延长的视频素材进行seedance 2.0合规校验的内容相关,直观呈现了操作步骤中的关键环节。
图片展示了视频编辑软件界面中视频节点部分。画面左上角显示“视频节点”,右上角有“1284×716”字样。画面中间是视频画面,显示两人在室内对话,左侧人物身着紫色古装,右侧人物身着蓝色古装。画面左下角有播放控制按钮,右下角有时间轴。画面左上角蓝色框内有一个“O”形图标,可能是视频编辑中的特定功能标识。该图片与上文介绍的视频编辑操作相关,展示了视频编辑界面中视频节点区域的样式和部分功能标识。
图片展示了视频编辑软件界面中视频节点部分。画面左上角显示“视频节点”,右上角有“1284×716”字样。画面中间是视频画面,显示两人在室内对话,左侧人物身着紫色古装,右侧人物身着蓝色古装。画面左下角有播放控制按钮,右下角有时间轴。画面左上角蓝色框内有一个“O”形图标,可能是视频编辑中的特定功能标识。该图片与上文介绍的视频编辑操作相关,展示了视频编辑界面中视频节点区域的样式和部分功能标识。

只需要在提示词开头写上:将@视频延长XX秒。

但实测下来,抽卡率有点高,效果没有提取上一段视频的尾帧那样稳,音色的还原也比较一般。

图片展示的是Seedance 2.0的界面,处于“全能参考”模式。画面中显示了“将视频1延长6秒”的操作提示,以及对视频1、图片2、图片3的描述,分别是陆远铮心虚地闭嘴、沈宁的近景及中景动作。该图片与上下文紧密相关,上下文在介绍Seedance 2.0全能参考的使用技巧,特别是素材衔接技巧中的延长视频方法,此图直观呈现了操作及参考素材的具体内容。
图片展示的是Seedance 2.0的界面,处于“全能参考”模式。画面中显示了“将视频1延长6秒”的操作提示,以及对视频1、图片2、图片3的描述,分别是陆远铮心虚地闭嘴、沈宁的近景及中景动作。该图片与上下文紧密相关,上下文在介绍Seedance 2.0全能参考的使用技巧,特别是素材衔接技巧中的延长视频方法,此图直观呈现了操作及参考素材的具体内容。

直接延长视频和抽帧接力,在实际剪辑的时候,对剪辑能力其实是有一定要求的。

因为即便你是用上一段视频的尾帧去作为下一段视频的首帧,视频在重新生成的过程中,画面还是会发生一些变化。比如人物比例、背景细节、色调、光线,都有可能和前一段不完全一致。所以很多时候你会发现,它理论上是接上了,但实际看起来还是会有一点卡顿感,或者有一些不自然的变化。

所以这里我不建议大家盲目去用这种方式硬接。

尤其是在短剧制作里,我们大多数时候还是要回到镜头剪辑本身。镜头和镜头之间,不一定非要靠首尾帧或者延长视频去强行连起来。很多时候,只要你掌握了镜头组接的基本原则,直接切镜头反而会更自然、更干净。

比如景别要有变化,动作要能接上,视线方向要合理,人物空间关系不能乱,剪辑点要干净。这些原则掌握之后,即便不用前面讲到的那些方法,你也可以很好地控制镜头之间的衔接。

短剧本身就是一个非常依赖剪辑节奏的内容形式,不要总想着把镜头硬连成长镜头。该切的时候就切,只要切得合理,观众是不会觉得突兀的。

关于镜头组接的这些基本原则,后面的视听语言直播课里,老师会给大家详细讲。

7)即梦等平台真人审核限制

如果使用libtv的seedance 2.0模型创作的小伙伴,下面这部分内容可以不看了。

对于使用即梦等其他平台的seedance 2.0模型的小伙伴来说,在上传参考图时,目前即梦平台针对真人照片和面孔会设置限制,拦截极度写实的真人照片或明星面孔。如果你的剧本就是想用某个特定真人的长相特征,直接上传原图大概率会面临生成失败或违规提示。

图片展示的是即梦平台对上传参考图的提示界面。画面中,穿着汉服的人物正在交谈,背景为古代建筑。平台提示识别到上传素材包含人脸信息,需调整素材后再试,提供了“重新编辑”和“再次生成”按钮。该图片与上下文紧密相关,上下文提到即梦平台对真人照片和面孔有审核限制,上传原图可能面临生成失败或违规提示,此图直观呈现了平台的审核反馈情况。
图片展示的是即梦平台对上传参考图的提示界面。画面中,穿着汉服的人物正在交谈,背景为古代建筑。平台提示识别到上传素材包含人脸信息,需调整素材后再试,提供了“重新编辑”和“再次生成”按钮。该图片与上下文紧密相关,上下文提到即梦平台对真人照片和面孔有审核限制,上传原图可能面临生成失败或违规提示,此图直观呈现了平台的审核反馈情况。

但制作AI仿真人短剧又绝对绕不开真人写实风格的角色资产的。下面教大家几个提高成功率的方法。

##### (1)a. 局部面部转绘 (脸部轮廓可能改变)

利用即梦/香蕉等图片模型,对图片的面部进行重绘。

图片展示了局部面部转绘的示例。左侧是一位穿着古装的男性,面部为彩色素描效果,其他部位如服装、发型颜色等保持原样。右侧有该男性从正面、侧面、背面的全身照,服饰细节清晰。下方提示语强调仅将皮肤区域(面部)转绘为彩色素描效果,其他部分不改变。此图与上文提到的利用即梦/香蕉等图片模型对图片面部进行重绘,以保留人物骨相和核心特征、让脸部恰好低于系统判定阈值的内容相呼应。
图片展示了局部面部转绘的示例。左侧是一位穿着古装的男性,面部为彩色素描效果,其他部位如服装、发型颜色等保持原样。右侧有该男性从正面、侧面、背面的全身照,服饰细节清晰。下方提示语强调仅将皮肤区域(面部)转绘为彩色素描效果,其他部分不改变。此图与上文提到的利用即梦/香蕉等图片模型对图片面部进行重绘,以保留人物骨相和核心特征、让脸部恰好低于系统判定阈值的内容相呼应。
图片展示了利用即梦/香蕉等图片模型对图片面部进行重绘的效果。左侧为局部面部转绘,保留人物骨相和核心特征,脸部恰好低于系统判定阈值。右侧是全身照,人物穿着深蓝色带有金色花纹的长袍,内搭白色衣物,头戴白色发饰,束发成高髻,从正面、侧面和背面展示了全身造型。此图直观呈现了局部面部转绘的参考生视频效果,与上下文介绍的使用技巧相契合。
图片展示了利用即梦/香蕉等图片模型对图片面部进行重绘的效果。左侧为局部面部转绘,保留人物骨相和核心特征,脸部恰好低于系统判定阈值。右侧是全身照,人物穿着深蓝色带有金色花纹的长袍,内搭白色衣物,头戴白色发饰,束发成高髻,从正面、侧面和背面展示了全身造型。此图直观呈现了局部面部转绘的参考生视频效果,与上下文介绍的使用技巧相契合。

这样能在保留人物骨相和核心特征的同时,让脸部恰好低于系统对“绝对真实照片”的判定阈值。此方法成功率近乎百分之百,并且仅对脸部进行重绘,衣服细节仍能保持较高的还原度。不过,其不足之处在于,生成视频素材时,脸部相似度会稍有降低。

##### (2)b. 平台站内洗图 (需要多次尝试)

这是一个非常实用且巧妙的过审技巧,核心逻辑是让平台信任自家产出的数据。

将你准备好的高写实人物三视图,先上传到即梦的图像生成模块中进行一次轻微的修改,或者直接通过提示词让即梦在图片的角落生成一行字:“此人物由AI生成”。

修改完成后,直接在即梦工作台里将这张图拖入视频生成模块中引用。这一步必须在即梦平台内部完成! 平台系统有概率会将其识别为自家 AI 生成的合法原生资产。千万不要耍小聪明在本地用 PS 加上这句话再上传,这种是无效的。

图片展示了在即梦等平台使用Seedance 2.0全能参考生成视频时,角色脸部得到较好还原的场景图。画面中,一位身着古装的男子站在不同角度,背景为淡雅的室内环境。右上角有红色中文标记“此人物由AI生成”。该图片与上下文紧密相关,用于说明在即梦等平台真人审核限制下,通过多次尝试,可绕过平台站内洗图限制,生成角色脸部还原较好的视频。
图片展示了在即梦等平台使用Seedance 2.0全能参考生成视频时,角色脸部得到较好还原的场景图。画面中,一位身着古装的男子站在不同角度,背景为淡雅的室内环境。右上角有红色中文标记“此人物由AI生成”。该图片与上下文紧密相关,用于说明在即梦等平台真人审核限制下,通过多次尝试,可绕过平台站内洗图限制,生成角色脸部还原较好的视频。

这种方法的优势在于,角色脸部能得到更好的还原,但仍存在生成失败的可能性。一次生成四张图后,依次将它们拖入下方的视频生成模块作为参考图,逐一尝试,通常会有一张可用。

比如前面图生视频的时候我们选取的那个男主和女主对坐的场景图作为案例,在右上角添加文字后,实测只有第三张图能绕过审查。

图片展示了在即梦等平台使用Seedance 2.0全能参考模式绕过真人审核的示例。画面中男女主角对坐于室内,背景有屏风、绿植等。右上角有红色中文标记“人物由AI生成”。图片标注为“图片5.0 Lite | 16:9 | 2K”。图片下方有“重新编辑”“再次生成”按钮。该图片与上下文紧密相关,直观呈现了在右上角添加文字后,只有第三张图能绕过审查,且Seedance 2.0全能参考模式在生成结果上的优势。
图片展示了在即梦等平台使用Seedance 2.0全能参考模式绕过真人审核的示例。画面中男女主角对坐于室内,背景有屏风、绿植等。右上角有红色中文标记“人物由AI生成”。图片标注为“图片5.0 Lite | 16:9 | 2K”。图片下方有“重新编辑”“再次生成”按钮。该图片与上下文紧密相关,直观呈现了在右上角添加文字后,只有第三张图能绕过审查,且Seedance 2.0全能参考模式在生成结果上的优势。
图片展示的是一个视频生成界面,右上角有红色文字“沈宁是 图片2;陆远铮是 图片3;两人的座位顺序参考 图片1”。图片1中,沈宁和陆远铮对坐,图片2中沈宁坐在太师椅上,图片3中陆远铮坐在太师椅上。该图片与上下文内容相关,用于说明在Seedance 2.0全能参考模式下,参考生视频生成时对角色和座位顺序的设定,以绕过平台站内洗图的限制。
图片展示的是一个视频生成界面,右上角有红色文字“沈宁是 图片2;陆远铮是 图片3;两人的座位顺序参考 图片1”。图片1中,沈宁和陆远铮对坐,图片2中沈宁坐在太师椅上,图片3中陆远铮坐在太师椅上。该图片与上下文内容相关,用于说明在Seedance 2.0全能参考模式下,参考生视频生成时对角色和座位顺序的设定,以绕过平台站内洗图的限制。

一旦成功绕过审查,就生成结果而言,Seedance 2.0 的全能参考模式明显优于单纯的图生视频模式。无论是男女主角脸部的近景还是特写,都与角色资产图的还原度极高。

seedance全能参考.mp4下载 ↗

##### (3)c. 脸部加网格 (脸部网格需要多次抽卡)

对于四视图的角色图(特写+三视),主要限制人脸的就是左边的特写,要么不出四视图,只出三视图,不要左边的特写了,基本都能成功,但这样生成的视频一旦切到人物的近景就容易变成即梦脸。

为了解决这个问题,只需要将左边的脸部特写处理一下,增加一个网格,这样既能保证基本的脸部轮廓,又能做一些遮挡处理,成功率百分之70左右。最好用Nano Banana 2来改图(使用方法见第四课的手册),即梦改图脸会变,提示词如下:

香蕉多出几张图,多次尝试,有时候脸上的网格如果太稀疏了,容易失败。

图片展示了一位男士全身像,脸部有网格覆盖,其右侧有三个不同角度的全身像。图片下方文字说明需严格控制网格范围,确保仅覆盖皮肤,不遮住耳朵、头发、眼睛、嘴唇或衣领,且图中右侧所有全身像区域需保持一致。该图片与上文提到的Seedance 2.0脸部加网格技巧相关,直观呈现了网格覆盖及全身像保持一致的要求,辅助理解脸部网格使用规范。
图片展示了一位男士全身像,脸部有网格覆盖,其右侧有三个不同角度的全身像。图片下方文字说明需严格控制网格范围,确保仅覆盖皮肤,不遮住耳朵、头发、眼睛、嘴唇或衣领,且图中右侧所有全身像区域需保持一致。该图片与上文提到的Seedance 2.0脸部加网格技巧相关,直观呈现了网格覆盖及全身像保持一致的要求,辅助理解脸部网格使用规范。

##### (4)d. 脸部特写遮挡 (效果不错)

基本如果只有三视图(不包含脸部特写)是基本不会触发平台的人脸审核限制的。问题的关键就在四视图里的脸部特写。但如果不放脸部特写,只保留三视图,做视频的时候一旦切近景,很可能就会变成“即梦脸”。

于是我们可以在PS或者其他作图工具中,按照如下所示,画一个小方框遮住脸部的一侧区域,这样基本就能通过审核了。跑视频的时候,由于只遮住了一小半区域,AI是能通过另一半脸脑补出完整脸部长相的。

图片展示了多张角色参考素材,左侧为角色脸部特写,面部被模糊处理。右侧分别呈现角色正面、侧面和背面的全身照,角色身着紫色古装,搭配白色内衬,头饰精致,整体造型典雅。该图片与上下文关系紧密,是用于说明即梦等平台真人审核限制中脸部特写遮挡效果不错,以及多角色生成失败时要一个角色一个角色地尝试生成4秒视频,确保每个角色图通过审核后,再合到一起生成长素材的示例。
图片展示了多张角色参考素材,左侧为角色脸部特写,面部被模糊处理。右侧分别呈现角色正面、侧面和背面的全身照,角色身着紫色古装,搭配白色内衬,头饰精致,整体造型典雅。该图片与上下文关系紧密,是用于说明即梦等平台真人审核限制中脸部特写遮挡效果不错,以及多角色生成失败时要一个角色一个角色地尝试生成4秒视频,确保每个角色图通过审核后,再合到一起生成长素材的示例。

##### (5)e. 多角色生成失败

对于多角色的视频素材,不要一上来就像下面这样把几个角色全部参考,然后去跑15秒的视频。

这张图片呈现了Seedance 2.0生成视频时的参考内容,左侧红框内是真人参考图,标注出分别对应“陆老夫人”“沈宁”“陆远铮”的人物形象,说明需单独参考单个角色处理;右侧是生成视频对应的实景预览,展现了古代侯府大厅的场景,画面内有多个人物。结合上下文,这是为规避多角色生成失败的问题,指导用户采用逐个角色参考生成的方法,先确保单个角色的内容能通过审核后,再将多角色合成长素材。
这张图片呈现了Seedance 2.0生成视频时的参考内容,左侧红框内是真人参考图,标注出分别对应“陆老夫人”“沈宁”“陆远铮”的人物形象,说明需单独参考单个角色处理;右侧是生成视频对应的实景预览,展现了古代侯府大厅的场景,画面内有多个人物。结合上下文,这是为规避多角色生成失败的问题,指导用户采用逐个角色参考生成的方法,先确保单个角色的内容能通过审核后,再将多角色合成长素材。

一定要一个角色一个角色地利用如上的两种方法去尝试,让角色分别去跑4秒钟的视频,要确保每个角色图都能通过审核之后,再去将多角色合到一起来生成长素材。

##### (6)f. 文本脱敏

很多时候图片没问题,但提示词自投罗网了。各大平台不仅有图像审核,还有极度敏感的文本审核词库。

即使你的参考图过了审核,在写视频动态提示词时,也绝对不要出现任何真实明星或公众人物的名字。如果你想生成神似某个明星的动态,请将人名替换为客观的骨相与气质描写(例如:将某女星替换为“清冷骨相、驼峰鼻的东方古典美女”)。用外貌特征描写代替具象的专有名词,就能完美规避文本层的拦截。

5、可灵视频 3.0 Omni 的使用技巧 (选择性学习)

可灵视频 3.0 Omni (kling o3)模型同样是一个非常适合制作AI仿真人短剧的模型。支持音画同步、自定义分镜,支持上传/录制视频主体,支持对主体添加音色,同样最长支持15秒的素材生成。

⚠️注:建议大家优先选用Seedance 2.0模型。就短剧制作而言,该模型目前的效果远超其他模型。若同学们在掌握此模型后还有精力,可看看下面的内容。

下面教大家在可灵官网使用该模型的方法:(libtv中该模型名为kling o3,使用方法类似,在此不展开)

图片展示了可灵视频3.0 Omni的界面。左侧为可灵官网界面,有“使用教程”“参考视频”“参考图片”等选项,下方是“多模态指令输入区域”,可输入指令生成视频。右侧是Omni创作区域,有“图片/主体参考”“图生视频”“指令变换”“视频参考”四个选项卡,当前显示“视频参考”选项卡,画面中是一个房间场景,有床、电脑、玩偶等物品。该图片与上下文介绍的在可灵官网使用可灵视频3.0 Omni模型的方法相关,直观呈现了操作界面。
图片展示了可灵视频3.0 Omni的界面。左侧为可灵官网界面,有“使用教程”“参考视频”“参考图片”等选项,下方是“多模态指令输入区域”,可输入指令生成视频。右侧是Omni创作区域,有“图片/主体参考”“图生视频”“指令变换”“视频参考”四个选项卡,当前显示“视频参考”选项卡,画面中是一个房间场景,有床、电脑、玩偶等物品。该图片与上下文介绍的在可灵官网使用可灵视频3.0 Omni模型的方法相关,直观呈现了操作界面。

在Omni创作区域,有图片/主体参考、图生视频、指令变换、视频参考四个选项卡。

其中主体参考是用得最多的。图生视频则与在可灵的视频生成模块里使用可灵视频 3.0 模型的使用差别不大,只不过可以更加灵活地@主体。指令变换相当于视频编辑功能。视频参考则是可以参考视频内容/运镜,延续视频或者生成全新的画面。

图片展示了可灵视频3.0 Omni的界面,位于“视频生成”功能下。画面中“图片/主体参考”选项被红色框突出显示。下方提示支持最多7张参考图或主体,可使用@快捷调用,定义精彩互动。界面底部有视频3.0 Omni、1080p - 5s、音画同步、智能分镜等设置选项,以及“生成”按钮。该图片与上下文介绍的可灵视频3.0 Omni使用技巧相关,直观呈现了其界面操作部分。
图片展示了可灵视频3.0 Omni的界面,位于“视频生成”功能下。画面中“图片/主体参考”选项被红色框突出显示。下方提示支持最多7张参考图或主体,可使用@快捷调用,定义精彩互动。界面底部有视频3.0 Omni、1080p - 5s、音画同步、智能分镜等设置选项,以及“生成”按钮。该图片与上下文介绍的可灵视频3.0 Omni使用技巧相关,直观呈现了其界面操作部分。

1)可灵主体库

只需上传/拍摄一段 3-8s 的角色类视频,模型即可提取核心角色特征与原声音色,完美还原角色的样貌、身形、神韵。

这张图片展示的是可灵视频3.0 Omni的主体库操作界面,对应文档中介绍的创建角色主体的步骤内容。界面上方导航栏里“主体资产”被绿色框标注,是当前选中的功能板块,左侧的“素材”按钮也被红色箭头标出;界面中部有一个带加号的“创建”按钮,用于新建角色主体,下方已呈现出“沈宁”“陆菲夫人”等创建好的角色主体及对应素材缩略图,契合文档中上传角色视频提取核心特征的操作描述。
这张图片展示的是可灵视频3.0 Omni的主体库操作界面,对应文档中介绍的创建角色主体的步骤内容。界面上方导航栏里“主体资产”被绿色框标注,是当前选中的功能板块,左侧的“素材”按钮也被红色箭头标出;界面中部有一个带加号的“创建”按钮,用于新建角色主体,下方已呈现出“沈宁”“陆菲夫人”等创建好的角色主体及对应素材缩略图,契合文档中上传角色视频提取核心特征的操作描述。
图片展示的是可灵视频3.0 Omni创建主体界面。界面上方有“添加正面图/角色视频(必填,视频3 - 8s)”提示,下方有“历史创作”按钮。下方有“填写名称”和“选择标签”区域,以及“请描述主体的核心特征”输入框,提示字数不超过100字。底部有“取消”和“创建”按钮。图片与上下文关系紧密,直观呈现了上传图片或视频创建主体的操作界面,帮助用户了解创建主体的具体步骤和要求。
图片展示的是可灵视频3.0 Omni创建主体界面。界面上方有“添加正面图/角色视频(必填,视频3 - 8s)”提示,下方有“历史创作”按钮。下方有“填写名称”和“选择标签”区域,以及“请描述主体的核心特征”输入框,提示字数不超过100字。底部有“取消”和“创建”按钮。图片与上下文关系紧密,直观呈现了上传图片或视频创建主体的操作界面,帮助用户了解创建主体的具体步骤和要求。
图片展示的是可灵视频3.0 Omni编辑主体界面。左侧有三张不同角度的男性角色图片,中间是该角色的全身照。右侧有两个“添加其他视角图”选项。下方有多个音色选项,当前选中“无通色”音色。底部有“智能描述”按钮,以及“取消”和“确定”两个操作按钮。该界面用于编辑角色主体,与上下文介绍的可灵主体库功能相契合,只需上传/拍摄一段3 - 8s的角色类视频,模型即可提取核心角色特征与原声音色,完美还原角色样貌、身形、神韵。
图片展示的是可灵视频3.0 Omni编辑主体界面。左侧有三张不同角度的男性角色图片,中间是该角色的全身照。右侧有两个“添加其他视角图”选项。下方有多个音色选项,当前选中“无通色”音色。底部有“智能描述”按钮,以及“取消”和“确定”两个操作按钮。该界面用于编辑角色主体,与上下文介绍的可灵主体库功能相契合,只需上传/拍摄一段3 - 8s的角色类视频,模型即可提取核心角色特征与原声音色,完美还原角色样貌、身形、神韵。

一旦创建好主体后,在Omni的提示词输入界面,只需要输入“@”,即可调用包含设定好音色的角色。

图片展示了可灵视频3.0 Omni的提示词输入界面。界面右上角有“图片/主体参考”选项。在提示词输入框中,输入“@”后,会弹出下拉菜单,显示“从主体库添加”选项,下方提示“输入名称直接调用未添加主体”。该图片与上下文紧密相关,上下文提到在创建好主体后,只需在提示词输入界面输入“@”,即可调用包含设定好音色的角色,此图直观呈现了这一操作步骤。
图片展示了可灵视频3.0 Omni的提示词输入界面。界面右上角有“图片/主体参考”选项。在提示词输入框中,输入“@”后,会弹出下拉菜单,显示“从主体库添加”选项,下方提示“输入名称直接调用未添加主体”。该图片与上下文紧密相关,上下文提到在创建好主体后,只需在提示词输入界面输入“@”,即可调用包含设定好音色的角色,此图直观呈现了这一操作步骤。
图片展示的是可灵视频3.0 Omni的主体库界面。界面上方有“全部19”“收藏”“角色”“动物”“道具”“服饰”“场景”“特效”“其他”等分类标签。主体库中呈现了多个角色形象,如沈宁、蒙儿、沈宇、陆子夫人、陆远静、沈宁白衣等,部分角色下方有数字序号标识。该图片与上下文介绍的可灵主体库功能相关,直观呈现了可灵主体库中可调用的角色形象。
图片展示的是可灵视频3.0 Omni的主体库界面。界面上方有“全部19”“收藏”“角色”“动物”“道具”“服饰”“场景”“特效”“其他”等分类标签。主体库中呈现了多个角色形象,如沈宁、蒙儿、沈宇、陆子夫人、陆远静、沈宁白衣等,部分角色下方有数字序号标识。该图片与上下文介绍的可灵主体库功能相关,直观呈现了可灵主体库中可调用的角色形象。

2)智能分镜

在提示词写法方面,可灵与之前的 Seedance 2.0 差别不大。然而在实际应用中,可灵生成效果在很大程度上依赖创作者的经验。简单来讲,它不像 Seedance 2.0 那样上手容易。

使用 Seedance 2.0 时,或许直接把剧本当作提示词一股脑丢给模型,即便不依照前面提到的输入结构化分镜提示词,也能产生相当不错的效果。但可灵视频 3.0 omini 模型就没那么智能,指令越清晰明确,生成效果才会越好。

我们正常地调用提前创建好的角色和场景主体,按照两种提示词的写法来分别做出尝试:

直接输入剧本:

图片展示的是可灵视频3.0 Omni的界面。界面上方有“视频生成”“图片生成”等选项卡,下方有多个角色图片及对应名称。画面中间是角色对话内容,包括沈宁、陆远铮、林娇娇等角色的台词。底部有“视频3.0 Omni”“1080p 15s”“音画同步”“智能分镜”等设置选项,右侧有“生成”按钮,显示已生成135秒视频。该图片与上下文介绍的可灵视频3.0 Omni智能分镜功能相关,展示了其操作界面及生成效果。
图片展示的是可灵视频3.0 Omni的界面。界面上方有“视频生成”“图片生成”等选项卡,下方有多个角色图片及对应名称。画面中间是角色对话内容,包括沈宁、陆远铮、林娇娇等角色的台词。底部有“视频3.0 Omni”“1080p 15s”“音画同步”“智能分镜”等设置选项,右侧有“生成”按钮,显示已生成135秒视频。该图片与上下文介绍的可灵视频3.0 Omni智能分镜功能相关,展示了其操作界面及生成效果。

开启自定义分镜,输入结构化分镜提示词:

图片展示的是可灵视频3.0 Omni智能分镜功能的分镜提示词界面。界面上方有“镜头1”“镜头2”等编号,每个镜头后有时长及描述,如“采用真人实拍视觉风格,全景,固定,沈宁倒在柴房的枯草中,死死瞪着前方”。画面中还出现多个角色名称,如“陆远铮”“林娇娇”等,以及一些音效提示,如“粗重的喘息声”“骨骼与泥土的摩擦声”。该图片与上下文介绍的可灵视频3.0 Omni智能分镜功能相契合,直观呈现了其分镜提示词的样式和内容。
图片展示的是可灵视频3.0 Omni智能分镜功能的分镜提示词界面。界面上方有“镜头1”“镜头2”等编号,每个镜头后有时长及描述,如“采用真人实拍视觉风格,全景,固定,沈宁倒在柴房的枯草中,死死瞪着前方”。画面中还出现多个角色名称,如“陆远铮”“林娇娇”等,以及一些音效提示,如“粗重的喘息声”“骨骼与泥土的摩擦声”。该图片与上下文介绍的可灵视频3.0 Omni智能分镜功能相契合,直观呈现了其分镜提示词的样式和内容。
可灵演示1.mp4下载 ↗

直接输入剧本 开启自定义分镜

大家看出区别了没?

要是不开启“自定义分镜”,仅仅在提示词输入界面输入剧本,即便已经开启 “智能分镜” 选项,依然有可能出现完全不切镜的状况。要是直接生成 15 秒的长镜头,画面不出现问题才奇怪呢。

所以,对于时长只有几秒钟的素材,大家可以直接用简洁的语言输入,或者采用标准提示词格式进行输入。但对于十几秒的较长素材,就一定要开启“自定义分镜”功能。

自定义分镜可以进行镜头级别的精确掌控,明确指定每个镜头的时长、景别、视角、叙事内容以及运镜方式等等,完成镜头之间的起承转合。一次生成,即可完成节奏分明、结构完整的多镜头叙事。

具体的操作步骤如下:

在图片/主体参考模式下,选择 视频3.0 Omni模型,勾选智能分镜,点击自定义分镜。

图片展示了视频生成界面中“图片/主体参考”模式下的操作区域。画面中用红色框和箭头突出显示了“选择模型”处的“视频3.0 Omni”选项、“选择模式”处的“图片/主体参考”选项、“开启智能分镜,选择自定义分镜”处的“智能分镜 自定义分镜”按钮。这些操作步骤与文档中介绍的在图片/主体参考模式下选择视频3.0 Omni模型、勾选智能分镜并点击自定义分镜的操作相呼应,直观呈现了操作要点。
图片展示了视频生成界面中“图片/主体参考”模式下的操作区域。画面中用红色框和箭头突出显示了“选择模型”处的“视频3.0 Omni”选项、“选择模式”处的“图片/主体参考”选项、“开启智能分镜,选择自定义分镜”处的“智能分镜 自定义分镜”按钮。这些操作步骤与文档中介绍的在图片/主体参考模式下选择视频3.0 Omni模型、勾选智能分镜并点击自定义分镜的操作相呼应,直观呈现了操作要点。

按照前面教大家的,将剧本拆成包含时长、景别、运镜、画面内容的结构化分镜提示词,然后一条一条地复制进来,在每一条提示词中都@主体库,调用里面的角色、场景、道具等。

图片展示的是可灵视频3.0 Omni的智能分镜界面。画面中呈现了多个分镜,每个分镜包含时长、景别、运镜、画面内容等信息。如镜头1时长2s,采用固定镜头,画面中出现“沈宁白”“林娇娇”等角色。画面还突出显示了“将用到的主体库调用并在提示词中@”的提示,以及“1、根据分镜脚本,确定每个分镜的时间”“2、将结构化分镜提示词逐条输入”等操作步骤。该图片与上下文介绍的智能分镜操作技巧相关,直观呈现了操作界面及要点。
图片展示的是可灵视频3.0 Omni的智能分镜界面。画面中呈现了多个分镜,每个分镜包含时长、景别、运镜、画面内容等信息。如镜头1时长2s,采用固定镜头,画面中出现“沈宁白”“林娇娇”等角色。画面还突出显示了“将用到的主体库调用并在提示词中@”的提示,以及“1、根据分镜脚本,确定每个分镜的时间”“2、将结构化分镜提示词逐条输入”等操作步骤。该图片与上下文介绍的智能分镜操作技巧相关,直观呈现了操作界面及要点。

从理论上来说,对于角色与场景并不复杂,特别是角色数量在两个以内的情况,这样时长 15 秒的长素材效果还算可以。

但要是角色数量达到三个以上,且处于复杂的室内环境,台词又较长,那么生成效果就会明显变差。就像上述所举的例子,无论是场景、角色,还是台词、人物站位都不简单,最终呈现的效果都比较普通。

所以,建议大家如果想要生成较长的素材,尽量不要使用可灵视频 3.0 omni,而是多选用 seedance 2.0。可以把可灵视频 3.0 omni 当作 seedance 2.0 使用过程中的补充,用它来生成 10 秒以内、没那么复杂的镜头,效果会十分稳定。当Seedance 2.0 模型排队时间较长的时候,可以借助可灵、Vidu等生成一段段短素材再去拼接,也能拼成不错的作品。

3)其他玩法

##### (1)a. 指令变化

可以利用多模态文本 / 图片 /主体的输入信息,结合来驱动视频 3.0 omni 模型,轻松对原视频进行与主体与背景的增加、修改、删除,也可以修改视频的风格、天气、颜色、材质、景别视角等。

视频原片

修改素材.mp4下载 ↗

视频增加内容

图片展示了一把古铜色的钥匙,钥匙头呈心形,中间有四个小方格图案,钥匙柄上系着一条紫色流苏。图片位于介绍可灵视频3.0 Omni使用技巧中“指令变化”部分内容之后,可能是用于引出或强调视频增加内容等玩法,起到装饰或过渡的作用。
图片展示了一把古铜色的钥匙,钥匙头呈心形,中间有四个小方格图案,钥匙柄上系着一条紫色流苏。图片位于介绍可灵视频3.0 Omni使用技巧中“指令变化”部分内容之后,可能是用于引出或强调视频增加内容等玩法,起到装饰或过渡的作用。
图片展示的是可灵视频3.0 Omni的界面。界面上方有“视频生成”“图片生成”等选项,下方有“视频(必填)”“图片”等输入区域,其中“图片”区域显示了两张图片,一张是视频画面,另一张是钥匙图片。下方提示“在@视频中的桌子上增加一把@图片中的钥匙”。界面底部有视频格式、分辨率、声音等设置选项,右下角有“60生成”按钮。该图片与文档中介绍可灵视频3.0 Omni使用技巧的内容相关,展示了其指令输入界面。
图片展示的是可灵视频3.0 Omni的界面。界面上方有“视频生成”“图片生成”等选项,下方有“视频(必填)”“图片”等输入区域,其中“图片”区域显示了两张图片,一张是视频画面,另一张是钥匙图片。下方提示“在@视频中的桌子上增加一把@图片中的钥匙”。界面底部有视频格式、分辨率、声音等设置选项,右下角有“60生成”按钮。该图片与文档中介绍可灵视频3.0 Omni使用技巧的内容相关,展示了其指令输入界面。
加东西.mp4下载 ↗

视频删除内容

图片展示的是视频生成界面,上方有“视频生成”“图片生成”选项卡,当前选中“视频生成”。界面中有“图片/主体参考”“图生视频”“指令变换”“视频参考”“重置”等按钮。下方有“视频(必填)”“图片”输入框,以及“将@视频中背景里的盆栽去掉”指令。底部有“视频3.0 Omni”“1080p”“原声”选项,右下角有“60生成”按钮。该图片与文档中介绍视频生成相关操作的上下文对应,展示了操作界面及部分设置选项。
图片展示的是视频生成界面,上方有“视频生成”“图片生成”选项卡,当前选中“视频生成”。界面中有“图片/主体参考”“图生视频”“指令变换”“视频参考”“重置”等按钮。下方有“视频(必填)”“图片”输入框,以及“将@视频中背景里的盆栽去掉”指令。底部有“视频3.0 Omni”“1080p”“原声”选项,右下角有“60生成”按钮。该图片与文档中介绍视频生成相关操作的上下文对应,展示了操作界面及部分设置选项。
删东西.mp4下载 ↗

视频改背景

图片展示了一幅中国风的山水画背景,画面中有连绵的山峰、树木和河流,以淡雅的水墨画风呈现。前景是两把木质椅子,椅子设计古朴,椅背上有精美的雕刻图案。该图片与文档中“视频改背景”部分内容相关,可能是用于演示或说明视频改背景功能时的背景场景,直观呈现了视频背景的样式效果。
图片展示了一幅中国风的山水画背景,画面中有连绵的山峰、树木和河流,以淡雅的水墨画风呈现。前景是两把木质椅子,椅子设计古朴,椅背上有精美的雕刻图案。该图片与文档中“视频改背景”部分内容相关,可能是用于演示或说明视频改背景功能时的背景场景,直观呈现了视频背景的样式效果。
图片展示的是可灵视频3.0 Omni的视频生成界面。界面上方有“视频生成”和“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”和“图片”输入框,分别标注“@视频”和“@图片”。画面中间显示“将 @视频 中的背景修改为 @图片 中的背景”。底部有视频格式选择、清晰度和时长设置,以及“生成”按钮。该图片与文档中介绍可灵视频3.0 Omni使用技巧中视频改背景的内容相关,直观呈现了操作界面。
图片展示的是可灵视频3.0 Omni的视频生成界面。界面上方有“视频生成”和“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”和“图片”输入框,分别标注“@视频”和“@图片”。画面中间显示“将 @视频 中的背景修改为 @图片 中的背景”。底部有视频格式选择、清晰度和时长设置,以及“生成”按钮。该图片与文档中介绍可灵视频3.0 Omni使用技巧中视频改背景的内容相关,直观呈现了操作界面。
换背景.mp4下载 ↗

视频换视角/景别

图片展示的是视频生成界面,背景为黑色。界面中有“视频生成”“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”“图片”输入框,分别显示“@视频”“@沈宁”。生成指令为“女人的侧面极致特写,浅景深。女人说:‘今儿的茶,真不错’”。底部有“视频3.0 Omni”“720p · 5s”“原声”选项,以及绿色“45 生成”按钮。该图片与上文介绍视频换视角/景别的玩法相关,展示了使用指令生成视频的界面。
图片展示的是视频生成界面,背景为黑色。界面中有“视频生成”“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”“图片”输入框,分别显示“@视频”“@沈宁”。生成指令为“女人的侧面极致特写,浅景深。女人说:‘今儿的茶,真不错’”。底部有“视频3.0 Omni”“720p · 5s”“原声”选项,以及绿色“45 生成”按钮。该图片与上文介绍视频换视角/景别的玩法相关,展示了使用指令生成视频的界面。
换景别.mp4下载 ↗

视频换风格

图片展示的是可灵视频3.0 Omni的界面,用于视频换风格操作。界面上方有“视频生成”“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”“图片”输入框,提示将视频中的人物造型和场景改成现代风格。底部有“视频3.0 Omni”“1080p - 5s”“原声”等设置选项,以及一个绿色的“60 生成”按钮。该图片与上文介绍的视频换风格玩法相关,直观呈现了操作界面。
图片展示的是可灵视频3.0 Omni的界面,用于视频换风格操作。界面上方有“视频生成”“图片生成”选项卡,当前选中“视频生成”。下方有“视频(必填)”“图片”输入框,提示将视频中的人物造型和场景改成现代风格。底部有“视频3.0 Omni”“1080p - 5s”“原声”等设置选项,以及一个绿色的“60 生成”按钮。该图片与上文介绍的视频换风格玩法相关,直观呈现了操作界面。
换风格.mp4下载 ↗

##### (2)b. 视频参考

可以上传3-10s 视频作为参考,配合文字、图片、或者主体等指令,生成下一个分镜头;或者参考视频内的动作/运镜,生成全新的视频画面。

生成下一个镜头

这张图片展示了可灵视频3.0 Omni的操作界面,核心功能为视频生成。界面顶部设有视频生成、图片生成等功能选项,当前选中“视频生成”,左侧有需填写的“视频(必填)”选项以及“图片”上传按钮,还有已添加的视频和“沈宁”相关素材标识。中间区域显示了生成视频的指令内容:基于视频,生成中景拍摄男女前方的镜头,描述了人物动作与氛围;下方可选择视频模型、设置视频分辨率与时长,底部右下角为绿色的“45生成”按钮,整体呈现出该工具参考视频生成指定画面的操作场景。
这张图片展示了可灵视频3.0 Omni的操作界面,核心功能为视频生成。界面顶部设有视频生成、图片生成等功能选项,当前选中“视频生成”,左侧有需填写的“视频(必填)”选项以及“图片”上传按钮,还有已添加的视频和“沈宁”相关素材标识。中间区域显示了生成视频的指令内容:基于视频,生成中景拍摄男女前方的镜头,描述了人物动作与氛围;下方可选择视频模型、设置视频分辨率与时长,底部右下角为绿色的“45生成”按钮,整体呈现出该工具参考视频生成指定画面的操作场景。
下一个镜头.mp4下载 ↗

六)Seedance 2.0 原生字幕消除

使用Seedance 2.0制作竖屏短剧时,常常会不受控制地生成大量原生字幕。这些字幕往往带有诸多乱码,而且每段字幕的格式也不尽相同。此类字幕必须去除,因为甲方肯定不会接受,需将其去除后,在后期利用剪辑软件自行添加字幕。

图片展示了一段古装剧场景,画面中有两位身着华丽古装的演员。左侧女性头戴发饰,身着绿色长袍,袍上有金色花纹;右侧男性头戴黑色发饰,身着蓝色长袍,袍上有金色龙纹。画面底部有红色框线突出显示的字幕“告头爷伪纹取利”。该图片与文档中“Seedance 2.0原生字幕消除”部分内容相关,用于说明此类字幕需去除,需在后期利用剪辑软件自行添加字幕。
图片展示了一段古装剧场景,画面中有两位身着华丽古装的演员。左侧女性头戴发饰,身着绿色长袍,袍上有金色花纹;右侧男性头戴黑色发饰,身着蓝色长袍,袍上有金色龙纹。画面底部有红色框线突出显示的字幕“告头爷伪纹取利”。该图片与文档中“Seedance 2.0原生字幕消除”部分内容相关,用于说明此类字幕需去除,需在后期利用剪辑软件自行添加字幕。

推荐用剪映里的AI消除功能,选择智能选取,找到素材里字幕最长的那一帧,涂抹一下,会自动识别字幕,随后点消除即可。这种方式需要消耗剪映会员的积分,但是方便,可以直接在剪辑软件里操作,不用来回折腾,而且效果较好。

图片展示了剪映中AI消除功能的界面。画面中有多个功能选项,其中“AI消除”功能被红色箭头指向,其下有“智能选区”“涂抹选区”“擦除选区”三个选项,当前“智能选区”被选中。该图片与文档中推荐用剪映AI消除功能去除视频原生字幕的内容相关,直观呈现了操作时的界面及选区选择情况,帮助用户了解如何使用此功能。
图片展示了剪映中AI消除功能的界面。画面中有多个功能选项,其中“AI消除”功能被红色箭头指向,其下有“智能选区”“涂抹选区”“擦除选区”三个选项,当前“智能选区”被选中。该图片与文档中推荐用剪映AI消除功能去除视频原生字幕的内容相关,直观呈现了操作时的界面及选区选择情况,帮助用户了解如何使用此功能。
图片展示了一段古装剧画面,画面中有两位身着华丽古装的演员,一位身着深色古装,头戴发饰,另一位身着蓝白相间的古装,腰间系有装饰。画面底部有蓝色底白字的字幕,内容为“就要拿着信条去敲登闻鼓”。该图片与文档中“Seedance 2.0原生字幕消除”部分内容相关,用于说明此类字幕需去除,可推荐使用剪映里的AI消除功能等方法处理。
图片展示了一段古装剧画面,画面中有两位身着华丽古装的演员,一位身着深色古装,头戴发饰,另一位身着蓝白相间的古装,腰间系有装饰。画面底部有蓝色底白字的字幕,内容为“就要拿着信条去敲登闻鼓”。该图片与文档中“Seedance 2.0原生字幕消除”部分内容相关,用于说明此类字幕需去除,可推荐使用剪映里的AI消除功能等方法处理。

Libtv智能去字幕

图片展示了剪映软件中“智能去字幕”功能的操作界面。画面中有一个视频预览窗口,显示了古装人物对话场景。上方工具栏中,“智能去字幕”功能被红色箭头突出指向,其右侧有“智能擦除”和“框选擦除”两个选项。该图片与上下文紧密相关,上下文介绍了在视频生成中需去除原生字幕,推荐使用剪映里的AI消除功能,此图直观呈现了该功能在剪映软件中的位置,帮助用户快速找到操作入口。
图片展示了剪映软件中“智能去字幕”功能的操作界面。画面中有一个视频预览窗口,显示了古装人物对话场景。上方工具栏中,“智能去字幕”功能被红色箭头突出指向,其右侧有“智能擦除”和“框选擦除”两个选项。该图片与上下文紧密相关,上下文介绍了在视频生成中需去除原生字幕,推荐使用剪映里的AI消除功能,此图直观呈现了该功能在剪映软件中的位置,帮助用户快速找到操作入口。

可以选择智能擦除或者框选擦除两种模式。

智能擦除就是让AI自动识别字幕,并一键去除。

图片展示了Libtv智能去字幕功能的界面。画面中“智能去字幕”按钮被红色框突出显示,点击后弹出下拉菜单,其中“智能擦除”和“框选擦除”两个选项也被红色框标出。该图片与上下文紧密相关,上下文介绍了Libtv智能去字幕功能,可选择智能擦除或框选擦除两种模式,此图直观呈现了智能去字幕功能的操作界面及可选择的模式选项。
图片展示了Libtv智能去字幕功能的界面。画面中“智能去字幕”按钮被红色框突出显示,点击后弹出下拉菜单,其中“智能擦除”和“框选擦除”两个选项也被红色框标出。该图片与上下文紧密相关,上下文介绍了Libtv智能去字幕功能,可选择智能擦除或框选擦除两种模式,此图直观呈现了智能去字幕功能的操作界面及可选择的模式选项。

在框选擦除模式中,挑选字幕最长的那一行,手动框选字幕所在区域。随后,AI会对该区域进行整体擦除。

图片展示的是视频生成作业中生成的视频片段画面。画面中,一位身着华丽服饰的女性和一位身着传统服饰的男性并肩而立,背景为古风建筑。画面下方有蓝色底白字的字幕,内容为“就要拿着信条去敲登闻鼓”。画面左下角有播放进度条,显示当前时间为0:10,总时长为0:15。该图片与文档中“第三次作业:视频镜头生成(无需提交)”的内容相关,是利用上节课生成的角色、场景、道具等资产图,使用即梦(Seedance 2.0)或其他视频模型生成的视频素材示例。
图片展示的是视频生成作业中生成的视频片段画面。画面中,一位身着华丽服饰的女性和一位身着传统服饰的男性并肩而立,背景为古风建筑。画面下方有蓝色底白字的字幕,内容为“就要拿着信条去敲登闻鼓”。画面左下角有播放进度条,显示当前时间为0:10,总时长为0:15。该图片与文档中“第三次作业:视频镜头生成(无需提交)”的内容相关,是利用上节课生成的角色、场景、道具等资产图,使用即梦(Seedance 2.0)或其他视频模型生成的视频素材示例。

七)第三次作业:视频镜头生成(无需提交)

具体内容:

  1. 动态转化: 利用上节课生成的角色、场景、道具等资产图,使用即梦(Seedance 2.0)或者其他视频模型,将自己剧本中的内容生成连贯的视频素材。
  2. 质量筛选:对于Seedance 2.0 生成的15秒长视频素材,学会甄别和筛选。下节课将教大家如何处理和优化有瑕疵的镜头。

原文版本:60 · 同步时间:2026/8/18 04:10:51

在飞书中查看原文 ↗

下一步可以读

AI 营销 · 约 12 分钟找准定位,选对努力方向从自身优势和现有资源出发,找到适合验证的营销方向。AI 营销 · 约 16 分钟找到流量,搭起自己的私域流量池完整学习私域流量的起步方法,建立可持续触达用户的入口。
完成入门后

把单点教程,变成一条完整路线

AI 一人公司实战圈提供连续训练、完整 SOP、案例复盘与直播答疑。

了解实战圈