微软Azure推出实时互动加文本转语音数字人AI工具
周末聊个新东西:微软Azure刚刚上线了一个文本转语音数字人的功能。

说起来,这已经不是微软第一次在数字人领域出手了。之前那个VASA-1,一张图就能生成视频,大家还有印象吧?
这次Azure悄悄推出的新功能,说白了就是一个能说话、会做表情的AI小人——输入文字,它就能变成带有情感色彩的语音,同时驱动一个数字人形象开口“演”出来。
当然,演示版本有限制。非Azure开发者(没付过钱的那种)只能用一个固定女性形象,而且连台词都是预设好的,改不了。起初还想着从网页源代码下手,看看能不能骗过它——结果微软的技术底子摆在那里,这点小把戏显然行不通。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524022292013514760"></iframe>数字人这个概念,经过英伟达ACE、开源项目、阿里Motionshop等一系列产品的洗礼,现在大家已经不陌生了。但微软这次推出的产品,在综合完成度上确实有自己的亮点。可能有人会说,每次都觉得不错,但小白上手还是费劲——没办法,数字人本身就有技术门槛,门槛越高,可调用的能力也越强。如果只求傻瓜式,剪映也能做,但那个效果……坦白说,太假了。
微软这个数字人的核心能力是:把文字转成自然的语音,同时匹配一个相对生动的虚拟形象。为什么说“相对”?实话实说,从实际生成的视频来看,虽然能眨眼、动嘴、做表情,整体还是能察觉到一丝僵硬。下面就是我用它生成的演示效果。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524012748227084294"></iframe>另一个值得关注的点是,这个数字人可以直接集成ChatGPT-4o。意思是,你搭建完数字人模型和Azure的TTS服务后,就能跟它实时对话,它能听懂问题并即时给出回应。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3524104498811633664"></iframe>搭建过程会不会很复杂?微软很贴心地提供了示例代码,专门用于集成文本转语音数字人与GPT-4o模型。而且说话时,数字人还能配合内容做出表情——眨眼、动嘴这些都是基本功。不过需要客观说一句,微软的语音合成技术虽然有感情色彩,但跟真人自然流露还是存在差距。
说到实际应用场景,这个项目的想象空间确实不小:
- ——比起冷冰冰的文字回复,一个会动会说话的AI客服显然更有人情味。
在线客服
- ——针对旅游景点做定制化服务,24小时在线的AI导游随时解答游客问题。
虚拟导游
- ——比如无人售卖柜,接入这个数字人做AI讲解,就不需要额外配人手了。
数字讲解员
整体来看,微软这个项目在体验和功能上都做得相当完整。最后把几个核心特性梳理一下:
- :文字输入后自动生成自然语音配数字人视频。
自然声音视频
- :提供一批现成的虚拟形象供选择。
预生成虚拟形象
- :覆盖英语、中文、日语等多种语言。
多语言支持
- :支持1920×1080分辨率、25帧/秒,画面流畅清晰。
高质量视频输出
- :录制10分钟视频,就能创建专属数字人,还能自定义背景。下面这个演示就是我用Midjourney生成背景图后上传的效果。
自定义虚拟形象
- :Speech Studio里的实时聊天工具,可以直接跟数字人对话。
实时互动
- :不会写代码?Speech Studio提供了可视化内容创建工具,小白也能上手。
无代码创建
- :支持接入GPT-4o等大模型,对话更智能。
大语言模型集成
看完这些功能,不得不感叹微软这次考虑得相当周全,从形象创建到实时互动再到模型集成,几乎是端到端地给了一条完整链路。
当然,目前语音TTS用的还是微软自己的方案,虽然提供了超过500种神经语音,但如果未来能让用户克隆自己的语音——比如用自己的声音创建数字分身,24小时在线回答粉丝问题——那体验就真的可以称得上“酷”了。这个方向,值得持续关注。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名