首页 > 教程攻略 > ai资讯 >可灵ai生成口播视频教程

可灵ai生成口播视频教程

来源:互联网 时间:2026-07-28 14:39:45

确认数字人可用并开启高级模式

这一步要是跳过,后面所有操作都会打水漂。先进入「我的分身」页面,检查目标数字人头像右下角有没有绿色【可用】标签。如果是灰色“待审核”或红色“失效”,那就得重新上传正脸照,等人工审核通过(通常2小时内)。审核过了才能继续。

接下来,点击右上角的齿轮图标,勾选「高级模式」。这时候页面左上角会出现一个“人物驱动”按钮,点亮它才算激活成功。注意,没有开启高级模式的情况下,即使上传了音频或粘贴了文本,驱动面板也不会显示——很多人卡在这里还不知道原因。

准备驱动源:音频还是文本?

两种驱动方式各有适用场景。音频驱动更精准,适合已经有配音文件、需要复刻特定语气和节奏的情况;文本驱动更灵活,适合写好口播稿直接生成全流程内容。

方法一:用音频驱动


准备一段10–60秒的纯净人声MP3或WA V文件,要求单声道、16kHz采样率、无背景音乐、无剪辑断点。手机录音后,务必用Audacity之类的工具删掉首尾2秒的静音段,否则系统会误判起始点,导致嘴型错位。这个细节很多人忽略,结果出来嘴型对不上声音,还以为是软件问题。

方法二:用文本驱动


文案必须是简体中文口语化表达,每句控制在6秒以内。避免“综上所述”“因此可见”这类书面连接词——比如把“本产品具备三大核心优势”改成“它有三个厉害的地方:第一……第二……第三……”。另外,

禁用中英文混排符号(如“/”“-”“@”),这些符号会导致TTS引擎崩溃

,生成过程中直接报错。

执行人物驱动并调节自然度参数

第一步:点击左侧工具栏的「人物驱动」按钮,切换到配置面板。

第二步:根据驱动源类型,点击「上传音频」或「输入文本」页签。

第三步:音频用户上传文件后,务必点击「试听驱动效果」——这个按钮只播放声音加口型模拟,不渲染画面。如果发现张嘴延迟明显或闭嘴过早,立即返回调整音频起始静音段,直到波形首个能量峰与首音节完全对齐。这一步反复试几次,直到满意为止,比直接生成再重来要省时间。

第四步:文本用户粘贴文案后,在「音色选择」中必须指定含「Viseme-Optimized」后缀的音色(比如Lingyun (Emotion-Enhanced)),然后勾选「启用动态唇部微调」和「强制对齐音素边界」。这两项不勾选,嘴型就是机械开合,毫无微表情变化——效果跟早期动画片对口型差不多。

第五步:点击「生成配音」,等待进度条跑完。此时系统同步输出语音波形与口型动画帧序列,不是单纯合成音频。这一步需要耐心,不要中途刷新页面。

导出无水印口播视频

生成完成后,预览窗口下方会出现「下载MP4(H.265/1080p/60fps)」按钮。点击前务必勾选「去除平台水印」选项——这个选项默认是关闭的,不勾选的话导出的视频右下角会带可灵LOGO,而且后期无法擦除。很多用户忘了这一步,最后还得重新生成。

点击下载,文件会自动保存到浏览器默认下载目录,命名包含时间戳和数字人名称。拿到这个视频,就可以直接用于抖音、视频号、公众号发布了,不需要额外剪辑软件。