首页 > 教程攻略 > ai资讯 >微软Azure推出实时互动加文本转语音数字人AI工具

微软Azure推出实时互动加文本转语音数字人AI工具

来源:互联网 时间:2026-08-14 14:35:19

周末聊个新东西:微软Azure刚刚上线了一个文本转语音数字人的功能。

微软Azure推出实时互动加文本转语音数字人AI工具

说起来,这已经不是微软第一次在数字人领域出手了。之前那个VASA-1,一张图就能生成视频,大家还有印象吧?

这次Azure悄悄推出的新功能,说白了就是一个能说话、会做表情的AI小人——输入文字,它就能变成带有情感色彩的语音,同时驱动一个数字人形象开口“演”出来。

当然,演示版本有限制。非Azure开发者(没付过钱的那种)只能用一个固定女性形象,而且连台词都是预设好的,改不了。起初还想着从网页源代码下手,看看能不能骗过它——结果微软的技术底子摆在那里,这点小把戏显然行不通。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524022292013514760"></iframe>

数字人这个概念,经过英伟达ACE、开源项目、阿里Motionshop等一系列产品的洗礼,现在大家已经不陌生了。但微软这次推出的产品,在综合完成度上确实有自己的亮点。可能有人会说,每次都觉得不错,但小白上手还是费劲——没办法,数字人本身就有技术门槛,门槛越高,可调用的能力也越强。如果只求傻瓜式,剪映也能做,但那个效果……坦白说,太假了。

微软这个数字人的核心能力是:把文字转成自然的语音,同时匹配一个相对生动的虚拟形象。为什么说“相对”?实话实说,从实际生成的视频来看,虽然能眨眼、动嘴、做表情,整体还是能察觉到一丝僵硬。下面就是我用它生成的演示效果。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524012748227084294"></iframe>

另一个值得关注的点是,这个数字人可以直接集成ChatGPT-4o。意思是,你搭建完数字人模型和Azure的TTS服务后,就能跟它实时对话,它能听懂问题并即时给出回应。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524104498811633664"></iframe>

搭建过程会不会很复杂?微软很贴心地提供了示例代码,专门用于集成文本转语音数字人与GPT-4o模型。而且说话时,数字人还能配合内容做出表情——眨眼、动嘴这些都是基本功。不过需要客观说一句,微软的语音合成技术虽然有感情色彩,但跟真人自然流露还是存在差距。

说到实际应用场景,这个项目的想象空间确实不小:

  1. 在线客服

    ——比起冷冰冰的文字回复,一个会动会说话的AI客服显然更有人情味。
  2. 虚拟导游

    ——针对旅游景点做定制化服务,24小时在线的AI导游随时解答游客问题。
  3. 数字讲解员

    ——比如无人售卖柜,接入这个数字人做AI讲解,就不需要额外配人手了。

整体来看,微软这个项目在体验和功能上都做得相当完整。最后把几个核心特性梳理一下:

  1. 自然声音视频

    :文字输入后自动生成自然语音配数字人视频。
  2. 预生成虚拟形象

    :提供一批现成的虚拟形象供选择。
  3. 多语言支持

    :覆盖英语、中文、日语等多种语言。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524050447621292033"></iframe>
  1. 高质量视频输出

    :支持1920×1080分辨率、25帧/秒,画面流畅清晰。
  2. 自定义虚拟形象

    :录制10分钟视频,就能创建专属数字人,还能自定义背景。下面这个演示就是我用Midjourney生成背景图后上传的效果。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524016458088972294"></iframe>
  1. 实时互动

    :Speech Studio里的实时聊天工具,可以直接跟数字人对话。
  2. 无代码创建

    :不会写代码?Speech Studio提供了可视化内容创建工具,小白也能上手。
  3. 大语言模型集成

    :支持接入GPT-4o等大模型,对话更智能。

看完这些功能,不得不感叹微软这次考虑得相当周全,从形象创建到实时互动再到模型集成,几乎是端到端地给了一条完整链路。

当然,目前语音TTS用的还是微软自己的方案,虽然提供了超过500种神经语音,但如果未来能让用户克隆自己的语音——比如用自己的声音创建数字分身,24小时在线回答粉丝问题——那体验就真的可以称得上“酷”了。这个方向,值得持续关注。