news 2026/9/5 6:09:43

Dify.AI 语音助手:3步打通语音交互完整链路

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Dify.AI 语音助手:3步打通语音交互完整链路

Dify.AI 语音助手:3步打通语音交互完整链路

【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/dify

用户对客服说了三分钟,系统却只回一句"未识别"?Dify.AI 语音助手解决的就是这个问题:录音转文字,LLM 生成回答,TTS 再把回答读出来。这条 Dify.AI 语音交互链路,跟着本文 3 步就能跑通。

能力全景:一张表看清语音链路

本节回答一个问题:Dify.AI 的语音功能到底覆盖哪些能力、边界在哪。

功能支持格式限制适用场景
语音转文字(STT)mp3 / m4a / wav / amr / mpga单文件 30MB录音转写、语音留言、通话质检
文字转语音(TTS)输出 AAC / MP3 / FLAC / WAV / OGG / WebM / MP4 音频流音色取决于所选模型提供商回答朗读、有声内容、无障碍播报

整条链路只有四个环节,声音进、文字出、文字出、声音出:

中间环节由应用本身完成:STT 把音频交给模型提供商转成文本,文本进入你配置的对话流或工作流,LLM 的输出再交给 TTS。整段逻辑集中在 api/services/audio_service.py,接口定义见 api/controllers/service_api/app/audio.py。

3步打通语音闭环:最小可行路径 🚀

本节给出跑通 Dify.AI STT 配置和 TTS 调用的最短路径。

第 1 步:添加语音模型提供商

  • 做什么:在"模型提供商"里选择一个带语音能力的提供商(如 OpenAI),填入 API Key。
  • 配什么:STT 用whisper-1,TTS 用tts-1之类的 TTS 模型。
  • 注意什么:提供商若完全不支持语音模型,调用会直接报provider_not_support_speech_to_text,先确认模型列表。

第 2 步:打开应用功能开关

  • 做什么:在应用的"功能"面板打开 speech_to_text 和 text_to_speech。
  • 配什么:TTS 在这里选音色,比如alloy(中性)或nova(女性、更亲和)。
  • 注意什么:开关没打开时,接口返回speech_to_text_disabled,这是新手最常见的报错。

第 3 步:两个接口验证闭环

# STT:上传录音,返回文本 curl -X POST "{base_url}/v1/apps/{app_id}/audio-to-text" \ -H "Authorization: Bearer {api_key}" -F "file=@demo.mp3" # TTS:提交文本,返回音频二进制 curl -X POST "{base_url}/v1/apps/{app_id}/text-to-audio" \ -H "Authorization: Bearer {api_key}" \ -H "Content-Type: application/json" \ -d '{"text":"你好,我是Dify语音助手","voice":"nova"}'

一个返回 JSON 文本,一个直接回音频字节流,Content-Type会标明具体容器格式。到这里,录音进、声音出的最小闭环已经成立。

场景实战一:语音客服——通话录音变工单

要解决什么:客服每天花大量时间人工听录音、手敲工单,既慢又容易漏信息。

怎么配:只开 STT 开关。把通话录音传给 audio-to-text,拿回文本后拼进你的 LLM 提示词,让它输出"问题摘要 + 处理建议"两个字段。需要回放某条历史语音回复时,不用重发文本,传消息 ID 即可:

# 回放某条消息的语音:传 message_id,无需重发 text curl -X POST "{base_url}/v1/apps/{app_id}/text-to-audio" \ -H "Authorization: Bearer {api_key}" \ -d '{"message_id":"<message_id>"}'

效果如何:3 分钟录音 10 秒变文字,客服只需核对字段,转写工作从人工变成接口调用。

场景实战二:内容创作——一句话出有声稿

要解决什么:做有声读物、视频口播时,配音是最耗时的环节。

怎么配:只开 TTS。Dify.AI TTS 音色选择的诀窍是:先查看当前提供商返回的音色列表,按性别和风格挑——中性通用选alloy,讲故事选fable,客服类选亲和感更强的nova;中文内容建议换用对中文优化的提供商,自然度差异明显。

效果如何:脚本交给 LLM 生成或人工写好,调 text-to-audio 拿到可播放的 MP3/AAC 流,直接进剪辑工具,单人一天能产出数小时配音量。

避坑清单:6个高频报错对照表 ⚠️

本节把真实接口会抛出的错误集中列出,报错时直接查表。

现象原因处理方法
speech_to_text_disabled应用功能开关未打开到功能面板打开 speech_to_text
provider_not_initialize没配置有效 API Key到模型提供商补填密钥
413audio_too_large文件超过 30MB前端压缩音频或分段上传
415unsupported_audio_type格式不在白名单转成 mp3 / m4a / wav / amr 再传
no voice availableTTS 未指定且无默认音色在 payload 里显式传voice参数
provider_quota_exceeded提供商额度用尽充值或切换到备用提供商

进阶与趋势

跑通最小闭环后,你可以往三个方向走:一是实时双向语音,把"上传整段文件"换成流式输入输出,做准实时的语音对话;二是音色个性化,用提供商的音色克隆能力让助手拥有专属声音;三是多语言实时转译,STT 识别一种语言、LLM 转译、TTS 用另一种语言读出来。

语音能力的源码入口(api/)、前端录音与播放组件(web/app/components/base/audio-btn/)和官方文档(docs/)都已就位。现在就拉下项目,按上面 3 步把你的第一个 Dify.AI 语音助手跑起来吧。

【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/dify

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 1:43:53

6路交错PWM实现:LAT1593中心对齐模式详解

6路交错PWM这个需求&#xff0c;我是在做一台48V转12V/100A输出的大功率DC-DC时遇到的。输入电流纹波和输出电容的发热都压在面前&#xff0c;单路PWM怎么调都过不了温升&#xff0c;最后只能上交错方案。而在LAT1593上把Up Down计数模式玩明白之后&#xff0c;6路相位差60度发…

作者头像 李华
网站建设 2026/9/2 10:50:49

stop-slop快速检查12项清单:每篇AI文本发出前的必备自检

stop-slop快速检查12项清单&#xff1a;每篇AI文本发出前的必备自检 【免费下载链接】stop-slop A skill file for removing AI tells from prose 项目地址: https://gitcode.com/GitHub_Trending/st/stop-slop stop-slop 是一款开源的技能文件&#xff08;Skill&#x…

作者头像 李华
网站建设 2026/8/31 22:13:47

gh-aw交互式向导教程:TUI界面3步生成你的专属工作流

gh-aw交互式向导教程&#xff1a;TUI界面3步生成你的专属工作流 【免费下载链接】gh-aw GitHub Agentic Workflows 项目地址: https://gitcode.com/GitHub_Trending/gha/gh-aw gh-aw&#xff08;GitHub Agentic Workflows&#xff09; 让开发者用 Markdown 编写 AI 驱动…

作者头像 李华
网站建设 2026/9/1 7:17:14

人形机器人本体厂的生态卡位:透过对外投资看产业链布局

人形机器人本体的发布会越来越密集&#xff0c;但比发布会更值得琢磨的&#xff0c;是乐聚机器人这类“本体厂”近期的对外投资动静。在表面动作背后&#xff0c;暗含的是人形机器人赛道正在进行的“生态卡位”战。很多人的目光还停在整机demo、关节自由度、步行速度和价格上&a…

作者头像 李华
网站建设 2026/9/2 10:08:50

AI原生网络索引与搜索API实战:从RAG到Agent的接入指南

AI 应用最近卷到哪一步了&#xff1f;大家慢慢发现&#xff0c;真正难的不是让模型“说得好”&#xff0c;而是让模型“知道得新、知道得准”。本地知识库也好&#xff0c;Agent 工具链也罢&#xff0c;一旦需要实时外部信息&#xff0c;就得靠网络搜索。但传统搜索接口返回的是…

作者头像 李华
网站建设 2026/9/1 11:39:50

DeepSeek-Reasonix配置向导实战:reasonix setup三步完成DeepSeek接入

DeepSeek-Reasonix配置向导实战&#xff1a;reasonix setup三步完成DeepSeek接入 【免费下载链接】DeepSeek-Reasonix DeepSeek-native AI coding agent for your terminal. Engineered around prefix-cache stability — leave it running. 项目地址: https://gitcode.com/G…

作者头像 李华