在你的边缘设备上部署流式语音识别(ASR)和语音合成(TTS)服务——支持 Jetson Orin、RK3576、RK3588 和第五代树莓派。
部署完成后你可以:
- 实时流式语音识别(WebSocket)
- 低延迟语音合成(HTTP 流式 + 批量)
- 多种语言模式:中文+英文、纯英文、或 52 种语言 Qwen3
- 通过 HTTP + WebSocket API(端口 8621)调用
前提条件: 可通过 SSH 连接设备 · 需要联网拉取 Docker 镜像和下载模型
在你的边缘设备上部署流式语音识别(ASR)和语音合成(TTS)服务——支持 Jetson Orin、RK3576、RK3588 和第五代树莓派。
部署完成后你可以:
前提条件: 可通过 SSH 连接设备 · 需要联网拉取 Docker 镜像和下载模型
将语音服务部署到你的边缘设备,模型在首次启动时自动下载。
通过 SSH 部署到 Jetson Orin,用 GPU 推理,支持多语言和声音克隆。需要至少 7.5 GB 可用磁盘。
recomputerjetson-zh-enen0中英文模式: 0-9,纯英文模式: 0-10(默认 8 = bf_isabella)
0.850.5 = 慢速, 1.0 = 正常, 1.5 = 快速
| 问题 | 解决方法 |
|---|---|
| SSH 连接失败 | 确认 IP 地址和凭据正确。先在电脑上试 ssh 用户名@IP |
| 镜像拉取慢 | 镜像压缩后约 2 GB,确保设备网络稳定 |
| 服务未启动 | 查看日志:ssh 用户名@IP "cd openvoicestream && docker compose logs" |
| 健康检查失败 | 首次启动需约 40 秒预热模型,稍等后重试 |
| 内存不足 | 确保 Jetson 有 8GB+ 内存,且没有其他 GPU 任务在运行 |
| 未找到 NVIDIA 运行时 | 安装:sudo apt install nvidia-container-toolkit && sudo systemctl restart docker |
服务已在 http://<设备 IP>:8621 运行。快速测试:
curl http://<设备 IP>:8621/health
# 预期返回: {"asr": true, "tts": true, "streaming_asr": true}
curl -X POST http://<设备 IP>:8621/tts \
-H "Content-Type: application/json" \
-d '{"text": "你好,我是你的语音助手。", "sid": 0}' \
--output test.wav
直接在此页面体验已部署的语音服务。输入设备 IP 地址,然后使用下方面板测试语音识别和语音合成。
按住 录音 按钮说话,语音将被实时识别,转录文字会即时显示在屏幕上。
输入任意文字,点击 生成 即可听到语音播放。
| 问题 | 解决方法 |
|---|---|
| 麦克风无法使用 | 浏览器弹出权限请求时请点击允许 |
| ASR 没有识别结果 | 确认服务正在运行:curl http://<IP>:8621/health |
| TTS 播放无声音 | 检查浏览器音量是否静音,尝试较短的文字 |
恭喜!本地语音服务已运行。
http://<设备 IP>:8621/health — 所有字段应显示 truecurl 命令测试语音合成| 接口 | 方法 | 说明 |
|---|---|---|
/health | GET | 服务健康检查 |
/asr/stream | WebSocket | 实时流式语音识别 |
/tts | POST | 文字转语音(返回 WAV) |
/tts/stream | POST | 流式文字转语音(返回原始 PCM) |
/asr | POST | 离线语音识别(上传 WAV 文件) |