
语音项目的硬件由三件事决定:做转写还是做对话、哪些环节必须留在本地、麦克风放在哪里。三件事分别决定是否需要扬声器与板上回声消除、算力盒子的档位,以及麦克风的型号与连接方式。
本文给出四步选型方法,附 reSpeaker 系列 AI 麦克风的形态、标称拾音距离与参考价,以及 5 款本地算力设备的语音转写并发实测、对话语言与本地大模型能力。并发路数为 ASR 服务在指定语料上的实测值,不含 VAD、上传与入库——取数口径见文末。
结论速查
以下为后文推导的结论汇总,与「音频与声音智能」技术页配置器的三个问题(要做什么 / 哪些要在本地完成 / 麦克风怎么放)一一对应。
| 要做什么 | 哪些在本地 | 算力设备 | 参考价 | 麦克风 | 依据 | |
|---|---|---|---|---|---|---|
![]() | 转写存档 | 本地转写 | reRouter CM4 | 约 $246 | 桌面:reSpeaker Lite | VAD 与 ASR 跑在 CPU,限 1–2 人单点;多点并发选 RK3576 |
![]() | 转写存档 | 本地转写 | reComputer RK3576 | 约 $199 | 房间:reSpeaker XVF3800 / 佩戴:reSpeaker Clip | SenseVoice 12 路并发,p95 1067 ms |
![]() | 转写存档 | 上传云端转写 | 不需要 | — | Lite / XVF3800 / Clip | 音频上传 SenseCraft Voice 转写,只买麦克风 |
![]() | 语音对话或可打断对话 | 语音在本地,大模型用云端 | reComputer RK3576 | 约 $199 | XVF3800 / Flex(不需要打断时可选 Lite) | 本地 VAD、ASR、TTS,只把识别出的文字发往大模型 |
![]() | 语音对话或可打断对话 | 全部在本地(含大模型) | reComputer J4012 | 约 $1299 | XVF3800 / Flex(不需要打断时可选 Lite) | 语音与 Qwen3.5-4B 同板 |
![]() | 语音对话或可打断对话 | 全部走云端 | reRouter CM4 | 约 $246 | XVF3800 / Flex(不需要打断时可选 Lite) | 本地只做 VAD 与音频收发,需持续联网 |
参考价为查询当时算力设备的整机参考价,不含麦克风(各型号价格见第二步),下单以商品页为准。
三项会改变上表结论的条件:
- 需要可打断 —— 麦克风限定 reSpeaker XVF3800 或 reSpeaker Flex,板上 AEC 消除设备自身播放的声音;配置器的可打断路线不含 Lite
- 对话语言不止中文、英文 —— reComputer RK3576 的对话链路覆盖中文、英文;其余语言选 reComputer RK3588、J3011 或 J4012,三者覆盖全部 30 种对话语言
- 说话人距麦克风超过约 3 m,或稳态噪声高于约 70 dB —— 先调整麦克风位置或数量,再讨论算力;识别准确率在这两个条件下先于算力劣化
已经知道需求、本地范围与麦克风位置的,用下面的配置器直接生成设备清单;想先弄清这些选择的依据,往下看四步方法。
为什么把语音处理放在本地
下面四步中「哪些在本地」是一个显式选项,选择依据来自本地处理的三项性质。
音频不出现场。 本地转写时,音频在现场完成 VAD 与 ASR,上传的是每句最终转写文本。语音在本地、大模型用云端时,发往云端的也只有识别出的文字。
装好后可断网运行。 全本地对话路线在首次联网启动、下载完镜像与模型后,VAD、ASR、TTS 与大模型均在设备上运行,不依赖外网。
对外接口与云端一致。 两条本地大模型路线(reComputer J4012、reComputer RK3588 + NPU 扩展卡)在设备上提供 OpenAI 兼容的 Chat Completions 接口,与云端套餐之间切换只改接口地址,上层应用不用改。
系统构成与三类语音能力

AI 麦克风 → 算力盒子 → 扬声器 / 输出 → 应用
语音系统由四类角色组成:
- AI 麦克风——拾音,并在板上完成回声消除(AEC)、降噪、波束成形等前端处理,处理后的音频再交给主机
- 算力盒子——运行需要留在本地的能力:语音活动检测(VAD)、语音识别(ASR)、语音合成(TTS)、大模型(LLM)
- 扬声器 / 输出——对话路线接扬声器播放回复,扬声器接在麦克风板上,回复播放与回声消除在同一块板上完成;转写路线只输出文字
- 应用——接收文字或语音,对接业务系统
按交互方式,语音应用分三类,所需能力依次增加。
转写存档:把说话内容变成可检索的文字

门店柜台、会议室、诊室、巡检现场的对话被转成结构化文本,用于复盘与检索。设备不需要回话,所以不需要 TTS、大模型与扬声器。需要的是 VAD(切出有人说话的片段)与 ASR。
语音对话:听懂后用语音回复

双手被占用的岗位,用语音查询与回复代替屏幕操作
设备听到问题后,由大模型生成回复,再用 TTS 播出,一问一答。在转写所需的 VAD、ASR 之上,增加 TTS、大模型与扬声器。
可打断对话:设备说话时用户可以插话
设备播放回复期间,用户开口,设备立即停止播放并听新的一句。这要求麦克风在扬声器发声时仍能分辨人声,因此依赖麦克风板上的 AEC。不要用播放期间静音麦克风的办法规避回声:回声消失的同时,打断也无法触发。
第一步:确定要做什么,推出需要哪些能力
| 要做什么 | VAD | ASR | TTS | 大模型 | 扬声器 | 麦克风板上 AEC |
|---|---|---|---|---|---|---|
| 转写存档 | 需要 | 需要 | — | — | — | — |
| 语音对话 | 需要 | 需要 | 需要 | 需要 | 需要 | 需要(Lite、XVF3800、Flex 均带) |
| 对话,且能随时打断 | 需要 | 需要 | 需要 | 需要 | 需要 | 需要,限 XVF3800 / Flex |
两条规则:
- 只要文字、设备不回话:走转写路线。第二步可选佩戴式 Clip,第三步可以不放算力盒子(上传云端转写)
- 设备要回话:麦克风板必须带扬声器输出与板上 AEC;如果用户会在设备说话时插话,第二步只能选 XVF3800 或 Flex
第二步:确定拾音方式与连接方式
按麦克风放在哪里选型号
| 麦克风 | 形态 | 标称拾音距离 | 覆盖角度 | 板载功放 | 适用 | 参考价 | |
|---|---|---|---|---|---|---|---|
![]() | reSpeaker Lite | 桌面放置 · 双麦 | 3 m | 180° | 5 W | 桌面近场,一两个人;转写、语音对话 | 约 $25 |
![]() | reSpeaker XVF3800 | 放置式 · 圆形四麦 | 5 m | 360° | 5 W | 房间中间,多人;转写、对话、可打断对话 | 约 $55 |
![]() | reSpeaker Flex Circular-4 | 分体式 · 圆形四麦 | 5 m | 360° | 10 W | 装进机器人或整机;对话、可打断对话 | 约 $55 |
![]() | reSpeaker Flex Linear-4 | 分体式 · 线形四麦 | 5 m | 约 180°(抑制后方) | 10 W | 整机只需前向拾音 | 约 $55 |
![]() | reSpeaker Clip | 佩戴式 · 双麦 | 3 m | 360° | — | 巡检、外勤、门店导购;仅转写 | 约 $76 |
四条选择规则:
- 多人围坐的房间,或需要可打断:选 XVF3800。360° 拾音,板上 AEC 与降噪,USB-C 一根线供电并传数据;对话式语音可部署方案默认使用它
- 麦克风要装进机器人或整机外壳:选 Flex。阵列板与处理板分体,经排线连接,阵列可放在外壳任意位置;只需前向拾音选 Linear-4。10 W 扬声器负载经板上外部 12 V 电源端子驱动
- 桌面一两个人,只做转写或不需要打断的对话:选 Lite
- 说话人要走动(巡检、外勤、导购):选 Clip。可脱离手机连续录音 14–18 小时,音频经手机 App 上传;只用于转写
按主机位置选连接方式
| 连接方式 | 音频路径 | 适用 |
|---|---|---|
| USB 直连主机(免驱) | 麦克风 → USB → 算力盒子 | 麦克风与算力盒子在同一位置;本文配置器的所有套餐均采用此方式 |
| I2S + XIAO ESP32S3 | 麦克风 → I2S → XIAO ESP32S3 → Wi-Fi → 服务器 | 麦克风与主机不在同一位置,或整机只放一块 MCU |
- 麦克风与算力盒子在一处:用 USB 直连,购买不带 XIAO 的版本,出厂即可使用
- 麦克风离主机远,或整机只放一块 MCU:购买带 XIAO ESP32S3 的版本,刷写 I2S 固件;服务端的音频接收与转写需自行部署,交付工作量高于 USB 路线。固件与示例工程见 reSpeaker XVF3800 Wiki
- Clip 不走以上两种方式,音频经手机 App 上传
适用边界。 拾音距离与覆盖角度为规格值,现场实际距离受混响与噪声影响,核对方法见第四步。
第三步:确定哪些在本地,选算力档
本地范围选项
| 本地范围 | 本地运行 | 上传内容 | 联网要求 | 对应算力 |
|---|---|---|---|---|
| 上传云端转写(仅转写) | 无 | 音频 | 持续联网 | 不需要算力盒子 |
| 本地转写(仅转写) | VAD · ASR | 每句最终转写文本 | 上传文本时联网 | reRouter CM4 / reComputer RK3576 |
| 语音在本地,大模型用云端 | VAD · ASR · TTS | 识别出的文字 | 持续联网 | reComputer RK3576 / RK3588 |
| 全部在本地(含大模型) | VAD · ASR · TTS · 大模型 | 无 | 首次启动后可断网 | reComputer J4012,或 RK3588 + NPU 扩展卡 |
| 全部走云端(对话) | VAD 与音频收发 | 音频 | 持续联网 | reRouter CM4 |
各算力档实测
| 设备 | 本地能跑 | SenseVoice 推荐并发路数 | p50 / p95 | 对话语言 | 本地大模型 | 参考价 | |
|---|---|---|---|---|---|---|---|
![]() | reRouter CM4 | VAD · ASR(CPU) | 仅适合 1–2 人单点;多点并发选 RK3576 | — | — | — | 约 $246 |
![]() | reComputer RK3576 | VAD · ASR · TTS(NPU) | 12 路 | 583 / 1067 ms | 中文、英文 | 走云端 | 约 $199 |
![]() | reComputer RK3588 | VAD · ASR · TTS(NPU) | 8 路 | 659 / 902 ms | 30 种 | 加 NPU 扩展卡运行 Qwen3-4B | 约 $279 |
![]() | reComputer J3011 | VAD · ASR · TTS(GPU) | 32 路 | 167 / 293 ms | 30 种 | 不在本板运行 4B 模型 | 约 $699 |
![]() | reComputer J4012 | VAD · ASR · TTS · 大模型 | 48 路 | 505 / 789 ms | 30 种 | Qwen3.5-4B 同板 | 约 $1299 |
测试条件:SenseVoice 模型,每条音频不超过 4 秒,p50 / p95 从 ASR 语音结束计时到最终结果,不含 VAD、上传与入库。准确率用同一份 100 条语料另行评估:中文 CER 在 4 台设备上均为 4.82%,英文 WER 在 7.50%–8.51% 之间。参考价为查询当时的整机参考价,以商品页为准。
四项选择规则:
- 仅转写、单点、一两个人:reRouter CM4 即可;多点或多路并发时选 reComputer RK3576
- 对话,大模型走云端:中文、英文选 reComputer RK3576;其他语言选 reComputer RK3588
- 对话,全部在本地:选 reComputer J4012;已采用 RK 平台的项目选 reComputer RK3588 + NPU 扩展卡(联系方案专家)
- 同一台设备还要跑视觉等 AI 负载:选 reComputer J3011,大模型走云端
适用边界。 上表为同一语料、同一 ASR 服务下的横向对照,用于确定选型区间,非验收指标。以下情况需在目标现场实测:单句音频明显长于 4 秒;需要把 VAD、上传与入库计入端到端时延;以英文或中英以外语言为主;用 reRouter CM4 做正式容量规划。
第四步:核对现场声学条件
算力选型成立的前提是麦克风拿到可识别的人声。判断顺序:先距离与噪声,再回声。
| 现场条件 | 参考边界 | 超出时的处理 |
|---|---|---|
| 说话人到麦克风的距离 | 约 3 m 以内 | 移近麦克风,或按区域增加麦克风;说话人走动时用 Clip |
| 稳态背景噪声 | 约 70 dB 以下 | 调整麦克风朝向与位置,远离噪声源;上线前用现场录音测一遍识别准确率 |
| 设备自身播放回复(对话) | 麦克风板上 AEC 生效 | 扬声器接在麦克风板上,使用 XVF3800 或 Flex |
超过约 3 m 或稳态噪声高于约 70 dB 时,阵列难以分出说话人,词错率在算力发挥作用之前已经劣化。这两个边界来自零售语音转写可部署方案的适用说明,用作现场勘察的判断线,不是实测阈值。
可打断对话的验收方式:扬声器开到正常房间音量,在真实房间内连续三轮,每轮在回复开始后 0.5–1 秒插话,确认旧回复立即停止且插话内容没有丢失。低音量下通过验收的终端,在实际工作音量下可能因声学原因失败,与模型无关。
面向方案商与系统集成商:从验证到交付
若方案用于向下游客户交付,以下三项在选型阶段确认。
验证路径。 语音对话与可打断对话有可运行的可部署方案,可用于提案阶段搭建演示环境:见 对话式语音 AI。
接入自有系统。 对话路线的对接点是 OpenAI 兼容的流式 Chat Completions 接口:把接口地址指向自有的 RAG 服务、工单或点单后台、机器人指令层,语音层不需修改。本地与云端大模型之间切换同样只改接口地址。转写路线把每句最终转写以文本形式上传到业务系统。
硬件定制与批量供货。 外壳、品牌标识、包装与接口改动可作为定制项目评估;reSpeaker Flex 的分体结构可按整机外壳布置阵列位置。具体定制范围、认证覆盖与交付周期见 ODM/OEM 定制服务。
取数口径与对照范围
并发路数与准确率为 ASR 服务的实测值,不是端到端验收值。 计时从 ASR 语音结束开始,到最终结果为止;VAD、上传与入库均不在其中。语料为每条不超过 4 秒的短句,长句与连续对话场景的表现需另测。
设备数据取自 Seeed 自有产品线,从入门网关 reRouter CM4 到 reComputer J4012,同一 ASR 服务与同一份语料。只用单一产品线做横向对照,是因为跨厂商的语音并发数据测试条件往往不统一——模型、语料长度、计时起止点任一项不同,数字即不可比。本文的方法(先定交互方式,再定拾音与本地范围,最后核对现场声学条件)与具体品牌无关,换成其他厂商的设备同样适用。
数据来源与测试条件
- SenseVoice 并发路数与 p50 / p95:OpenVoiceStream ASR 服务,SenseVoice;Jetson 并发语料 200 路、RK 并发语料 100 路,每条不超过 4 秒;计时从 ASR 语音结束到最终结果。出处:零售语音转写可部署方案工程文档
- 准确率:同一份 100 条语料;中文 CER 4.82%(J3011、J4012、RK3576、RK3588 一致),英文 WER J4012 7.62%、J3011 7.62%、RK3576 8.51%、RK3588 7.50%
- 对话语言:reComputer RK3576 为中文、英文;RK3588、J3011、J4012 为全部 30 种。出处:对话式语音 AI 可部署方案工程文档
- 麦克风参数:拾音距离、覆盖角度与功放取自 Seeed Wiki 各型号页与产品页,均为标称值
- 现场声学边界(约 3 m、约 70 dB):零售语音转写可部署方案工程文档的适用说明,为勘察判断线
- 参考价格:Seeed 商品页价格,随配置与时间变动,以商品页为准
本文数据用于确定选型区间。正式交付前,建议在目标现场用真实麦克风与真实音量完成一轮实测,重点验证识别准确率、可打断行为与端到端时延。










