千问AI视频描述词怎么写转场?
视频叙事,镜头切换是灵魂。但要让千问AI真正理解画面之间的起承转合,而不是把一组连续镜头当成“幻灯片”来读,就得在描述词里下点功夫了。问题的关键,其实就藏在那些看似不起眼的转场词汇里。
先说一个核心判断:千问AI对转场的理解是字面级别的。你对它说“然后”,它就只知道时间顺序,根本不知道是“切”过去的还是“叠”过去的。只有在描述词里明确写出转场方式,才能让AI构建出流畅的镜头叙事。
用动词精准表达转场动作
在两个镜头描述之间,插入一个表示视觉过渡的动词,这是最基础的一步。比如“切”“推”“拉”“叠化”“淡入”“摇”“移”。
举个例子:你描述“人物特写→
【切】
标注转场持续时长(关键帧控制)
光有动词还不够,还得加上时长。格式很简单,在转场动词后紧跟括号注明毫秒数,比如“书桌全景→
【推】(400ms)
为什么不写不行?因为没有时长声明,千问AI默认会采用最短的瞬时切换,大概在60ms左右。这会导致你精心设计的推进镜头瞬间被“秒切”掉,意图全失。反过来,如果时长超过800ms,AI又容易把它识别成叠化效果。所以,一个比较安全的区间是
200–700ms
区分物理运镜与光学转场
这里有个容易踩的坑:物理运镜和光学转场必须分开处理,不能混用。
物理运镜类,指的是摄像机真实移动,比如“推/拉/摇/移/跟/升/降”,描述时要加上方向和目标。比如“镜头左摇→空荡走廊尽头亮起一盏灯”。
光学转场类,则是后期制作的效果,比如“淡入/淡出/叠化/划像/翻页/马赛克溶解”,描述时需要明确起止状态。例如“黑屏→
【淡入】(600ms)
特别提醒:像“推→淡入”这种组合,AI是看不懂的。它只会识别第一个有效的转场指令,后面的会被忽略。所以,要么选物理运镜,要么选光学转场,别混在一起。
多镜头段落按时间轴排序标注
这是最耗功夫,但也是最关键的一步。如果漏掉时间校验,千问AI生成的描述词很可能与视频节奏严重错位,后续关键帧对齐也会乱套。
具体操作分四步:
第一步:从视频开头逐帧确认每个镜头的起止点,标注出绝对时间码,比如“00:00:05–00:00:12”。
第二步:按时间顺序列出所有镜头,每行一个,把转场词写在前面镜头的末尾。
第三步:检查相邻两行的时间是否连贯。如果出现断层,比如前镜头结束于00:00:12,后镜头却从00:00:15才开始,中间那3秒必须补上“黑场(3000ms)”或者“静帧(3000ms)”作为显式转场,否则AI会认为视频节奏断了。
第四步:最后检查一遍,删除所有没有对应实际画面变化的冗余转场词。哪怕语法通顺,只要没有实际画面切换,就不要保留。

从实践来看,大多数描述词不够精准的问题,归根结底出在对转场的“颗粒度”处理上。把动词写准,时长标对,物理与光学分开,再做好时间轴上的断层校验,千问AI才能真正理解你的镜头语言。