Dify x Open Audio:用 Fish Audio 插件轻松实现 TTS 和语音克隆
将语音能力集成到 AI 应用中,过去总是需要额外编写代码、对接 API、处理音频流,事情虽能做成,但过程相当繁琐。现在,Dify 的用户多了一个相当便利的选项——Fish Audio 已在 Dify Marketplace 上架,主要提供文本转语音(TTS)与语音克隆两大核心功能。

Open Audio 开发的这款 Fish Audio 插件,在 Dify Marketplace 上架后将高质量语音能力整合到了可视化工作流中。在 Dify 平台构建 AI 应用时,不必再一行行处理音频接口,直接在节点里拖拽就能完成文字到语音的转换,甚至连声音克隆都一并解决。
Fish Audio 的核心能力
Fish Audio 的核心能力
语音处理和生成方面,Fish Audio 主要提供了以下几项值得关注的功能:
语音合成 (TTS)
语音合成 (TTS)
实时文本转语音是它的基本功,支持通过 WebSocket API 实现流式音频输出。语速、音量这些常规参数都可以灵活控制,输出格式覆盖了 Opus、MP3、WA V 等常见音频格式,接入端的兼容性不用太担心。
语音克隆
语音克隆
这块是它比较有竞争力的点——只需要 30 到 45 秒的人声音频样本,就能快速完成一次语音克隆。换句话说,哪怕只有一段简短的录音,也能在几分钟内得到一个复刻版的声音模型。
Voice ID
Voice ID
在 Fish Audio 的体系里,Voice ID 就是每个语音模型的唯一标识符。每次克隆成功后系统会分配一串 ID,后续直接用这个 ID 来调取对应的声音。
创建自定义语音
创建自定义语音
如果对默认提供的音色不满意,Fish Audio 的“Build Voice”功能允许上传自己的录音素材训练定制化的声音模型。训练完成后,在“My Library”里就能找到专属模型。操作流程也不复杂:复制对应的 Voice ID,然后粘贴到 Dify 工作流中即可调用。
快速上手
快速上手
在 Dify 中使用 Fish Audio,第一步是先到 Dify Marketplace 搜索并安装 Fish Audio 插件。接下来要准备一个 Fish Audio API Key,以及对应的 endpoint URL,在插件设置里完成配置。配置环节需要注意选择适合的语音平衡模式,这个参数会影响最终输出的人声风格和稳定性。
在 Dify Chatflow 中集成 Fish Audio TTS
在 Dify Chatflow 中集成 Fish Audio TTS
以 Chatflow 为例,可以这样设计一个流程:让大型语言模型先生成文本内容,然后将这些文本通过 Fish Audio 的 TTS 节点自动输出为音频。具体配置时只有几个关键步骤:
- 指定需要转换为语音的文本,比如将 LLM 节点的输出直接连接至 TTS 的输入字段。
- 设置对应的 Voice ID,选择合成时使用的声音。
- 选择想要的音频文件格式。
这样一来,工作流就会自动把 LLM 生成的文字内容转化为指定语气和格式的语音。整个过程不需要写一行后端代码。
现实使用场景
现实使用场景
听多了抽象功能,我们来看几个具体能落地的场景。
多语言客服场景
教育与培训内容制作
播客与媒体内容创作
关于 Open Audio
关于 Open Audio
Open Audio 是 Hanabi AI Inc 旗下的研究实验室,主要面向开源社区提供音视频领域的项目。其产品 Fish Audio 在音频合成和语音识别方面的表现,在开源和闭源领域里都属于业内靠前的水平。
关于 Dify.AI
关于 Dify.AI
Dify.AI 是一个开源 AI 应用开发平台,通过灵活的插件机制、提示词编排、RAG、Workflow 和日志监测等特性,帮助开发者快速搭建 AI 应用,缩短从概念验证到大规模部署的周期。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名