首页 > 教程攻略 > 热点新闻 >阿里语音大模型全球评测获佳绩,三项核心能力均列国内首位

阿里语音大模型全球评测获佳绩,三项核心能力均列国内首位

来源:互联网 时间:2026-08-26 19:57:20

近日,在全球权威AI评测平台Artificial Analysis发布的语音排行榜(Speech Arena)中,阿里巴巴的语音大模型取得了亮眼成绩。其模型Fun-Realtime-TTS-Preview以1190分的Elo评分,位列全球第五,并成为国内排名最高的语音模型。

阿里语音大模型全球评测获佳绩,三项核心能力均列国内首位

此次评测涵盖了语音交互的三个核心赛道:ASR(语音转文字)、Chat(端到端语音理解与对话)以及TTS(文字转语音)。

阿里语音大模型在这三项关键能力上均获得了国内第一的评价

,实现了在语音交互领域的全面领先。这标志着该模型在“听得准”、“说得好”和“聊得棒”三个层次上均达到了行业先进水平。

技术能力实现“大满贯”

语音大模型的综合能力通常由ASR、TTS和Chat三部分构成,它们既独立又相互依赖,共同决定了最终的人机交互体验。此前,阿里语音大模型家族中的Fun-Realtime-ASR和Fun-Realtime-AudioChat模型,已在同一平台上分别于“听准”和“听懂会聊”指标上登顶全球榜首,整体表现超越了包括GPT-Realtime-2在内的国际顶尖模型。

已深度集成至多款国民应用

目前,阿里语音大模型技术已深度融入多个国民级应用,为用户提供切实的服务。例如,在千问App、高德地图、钉钉等产品中,

该技术支撑着实时语音转文字、智能导航交互、会议纪要自动生成等核心功能

,提升了产品的智能化体验和用户效率。

除了面向消费级应用,该模型还提供了企业级定制接口,能够灵活适配金融、医疗等对语音交互有特定要求的行业场景。此外,阿里语音团队开源的FunASR、CosyVoice等多款模型,在GitHub上已累计获得数万星标,受到了国内外开发者的广泛关注与采用。