小米语音首席科学家 Daniel Povey 当选 2026 ISCA Fellow,全球仅 100 余人获此殊荣
来源:互联网
时间:2026-07-17 13:30:37
7月16日,小米技术官方账号发布了一则消息:小米语音首席科学家Daniel Povey成功当选2026年度ISCA Fellow。这是国际语音通信协会(ISCA)授予的最高学术荣誉,自2007年设立以来,全球仅有100多人获此殊荣。

什么是ISCA Fellow?简单来说,它是语音通信领域学术界的顶尖认可。2026年,全球共有8位学者当选,Daniel凭借他在语音识别声学建模、序列训练方法上的创新,以及开源语音工具Kaldi的深远影响,成功拿下了这个席位。更值得一提的是,他是这8位学者中唯一一位亲手创建了行业基础设施级开源软件的科学家,在学术和工业界都有极其突出的贡献。
这已经是Daniel继2023年当选IEEE Fellow之后的又一项重磅荣誉。作为一个定义了一个时代的工具,以及创造行业基础设施的科学家,Daniel“双料Fellow”的头衔,确实实至名归。
Daniel的职业生涯,起步于剑桥大学。他2003年在那里拿到博士学位,随后进入工业界,先后在IBM T.J. Watson研究中心和微软研究院工作了大约十年,深耕语音识别核心技术。2019年11月,他移居北京,加入小米集团AI实验室,出任语音首席科学家。
加入小米后,Daniel带领团队推出了新一代Kaldi开源项目,旗下包含k2、Lhotse、Icefall、Sherpa四大子项目,在语音识别与合成方向持续取得里程碑式进展:
- 首先,Zipformer是首个严格超越Google Conformer的语音编码器,被ICLR 2024接收为Oral论文,属于前1.2%的顶尖作品。2026年升级版Zapformer,把识别精度再拉高了10%-15%,训练稳定性和泛化性也明显增强。
Zipformer & Zapformer 编码器:
- 2026年发布的OmniVoice,是一个支持600多种语言和方言的零样本语音合成模型,参数量仅0.8B,基于Qwen3初始化。只需3到10秒的参考音频,就能跨语言克隆音色。在中英文Seed-TTS和LibriSpeech-PC基准上达到SOTA,客观评测中甚至超越了MiniMax和ElevenLabs等商用模型。开源仅3个月,Huggingface下载量已突破500万次。
OmniVoice 多语言 TTS:
- 这项成果被ICLR 2025接收,它让纯CTC模型的性能比肩Transducer,在LibriSpeech、AISHELL-1、GigaSpeech等基准上刷新了SOTA。这大大降低了ASR的训练与部署门槛。
CR-CTC(Consistency-Regularized CTC):
- 基于Flow Matching和Zipformer骨干,推出了ZipVoice(零样本单说话人TTS)和ZipVoice-Dialog(零样本对话TTS)。参数量少、推理速度快,在CPU单线程上就能达到实时效果。配套的OpenDialog数据集也同步开源。
ZipVoice 零样本语音合成:
- 新一代Kaldi的端云一体推理引擎sherpa-onnx,支持高通、昇腾、瑞芯微等主流NPU,覆盖Android、iOS、嵌入式和服务端。被开发者们称为“智能语音领域的瑞士军刀”。
sherpa-onnx 全平台部署: