门店柜台前的语音交互场景

语音项目的硬件由三件事决定:做转写还是做对话、哪些环节必须留在本地、麦克风放在哪里。三件事分别决定是否需要扬声器与板上回声消除、算力盒子的档位,以及麦克风的型号与连接方式。

本文给出四步选型方法,附 reSpeaker 系列 AI 麦克风的形态、标称拾音距离与参考价,以及 5 款本地算力设备的语音转写并发实测、对话语言与本地大模型能力。并发路数为 ASR 服务在指定语料上的实测值,不含 VAD、上传与入库——取数口径见文末。

结论速查

以下为后文推导的结论汇总,与「音频与声音智能」技术页配置器的三个问题(要做什么 / 哪些要在本地完成 / 麦克风怎么放)一一对应。

要做什么哪些在本地算力设备参考价麦克风依据
转写存档本地转写reRouter CM4约 $246桌面:reSpeaker LiteVAD 与 ASR 跑在 CPU,限 1–2 人单点;多点并发选 RK3576
转写存档本地转写reComputer RK3576约 $199房间:reSpeaker XVF3800 / 佩戴:reSpeaker ClipSenseVoice 12 路并发,p95 1067 ms
转写存档上传云端转写不需要Lite / XVF3800 / Clip音频上传 SenseCraft Voice 转写,只买麦克风
语音对话或可打断对话语音在本地,大模型用云端reComputer RK3576约 $199XVF3800 / Flex(不需要打断时可选 Lite)本地 VAD、ASR、TTS,只把识别出的文字发往大模型
语音对话或可打断对话全部在本地(含大模型)reComputer J4012约 $1299XVF3800 / Flex(不需要打断时可选 Lite)语音与 Qwen3.5-4B 同板
语音对话或可打断对话全部走云端reRouter CM4约 $246XVF3800 / Flex(不需要打断时可选 Lite)本地只做 VAD 与音频收发,需持续联网

参考价为查询当时算力设备的整机参考价,不含麦克风(各型号价格见第二步),下单以商品页为准

三项会改变上表结论的条件:

  • 需要可打断 —— 麦克风限定 reSpeaker XVF3800 或 reSpeaker Flex,板上 AEC 消除设备自身播放的声音;配置器的可打断路线不含 Lite
  • 对话语言不止中文、英文 —— reComputer RK3576 的对话链路覆盖中文、英文;其余语言选 reComputer RK3588、J3011 或 J4012,三者覆盖全部 30 种对话语言
  • 说话人距麦克风超过约 3 m,或稳态噪声高于约 70 dB —— 先调整麦克风位置或数量,再讨论算力;识别准确率在这两个条件下先于算力劣化

已经知道需求、本地范围与麦克风位置的,用下面的配置器直接生成设备清单;想先弄清这些选择的依据,往下看四步方法。


为什么把语音处理放在本地

下面四步中「哪些在本地」是一个显式选项,选择依据来自本地处理的三项性质。

音频不出现场。 本地转写时,音频在现场完成 VAD 与 ASR,上传的是每句最终转写文本。语音在本地、大模型用云端时,发往云端的也只有识别出的文字。

装好后可断网运行。 全本地对话路线在首次联网启动、下载完镜像与模型后,VAD、ASR、TTS 与大模型均在设备上运行,不依赖外网。

对外接口与云端一致。 两条本地大模型路线(reComputer J4012、reComputer RK3588 + NPU 扩展卡)在设备上提供 OpenAI 兼容的 Chat Completions 接口,与云端套餐之间切换只改接口地址,上层应用不用改。


系统构成与三类语音能力

语音系统架构:AI 麦克风、算力盒子、扬声器与应用

AI 麦克风 → 算力盒子 → 扬声器 / 输出 → 应用

语音系统由四类角色组成:

  • AI 麦克风——拾音,并在板上完成回声消除(AEC)、降噪、波束成形等前端处理,处理后的音频再交给主机
  • 算力盒子——运行需要留在本地的能力:语音活动检测(VAD)、语音识别(ASR)、语音合成(TTS)、大模型(LLM)
  • 扬声器 / 输出——对话路线接扬声器播放回复,扬声器接在麦克风板上,回复播放与回声消除在同一块板上完成;转写路线只输出文字
  • 应用——接收文字或语音,对接业务系统

按交互方式,语音应用分三类,所需能力依次增加。

转写存档:把说话内容变成可检索的文字

多方向拾音

门店柜台、会议室、诊室、巡检现场的对话被转成结构化文本,用于复盘与检索。设备不需要回话,所以不需要 TTS、大模型与扬声器。需要的是 VAD(切出有人说话的片段)与 ASR。

语音对话:听懂后用语音回复

仓库工位上的语音终端:拣货员双手持物时用语音查询

双手被占用的岗位,用语音查询与回复代替屏幕操作

设备听到问题后,由大模型生成回复,再用 TTS 播出,一问一答。在转写所需的 VAD、ASR 之上,增加 TTS、大模型与扬声器。

可打断对话:设备说话时用户可以插话

设备播放回复期间,用户开口,设备立即停止播放并听新的一句。这要求麦克风在扬声器发声时仍能分辨人声,因此依赖麦克风板上的 AEC。不要用播放期间静音麦克风的办法规避回声:回声消失的同时,打断也无法触发。


第一步:确定要做什么,推出需要哪些能力

要做什么VADASRTTS大模型扬声器麦克风板上 AEC
转写存档需要需要
语音对话需要需要需要需要需要需要(Lite、XVF3800、Flex 均带)
对话,且能随时打断需要需要需要需要需要需要,限 XVF3800 / Flex

两条规则:

  1. 只要文字、设备不回话:走转写路线。第二步可选佩戴式 Clip,第三步可以不放算力盒子(上传云端转写)
  2. 设备要回话:麦克风板必须带扬声器输出与板上 AEC;如果用户会在设备说话时插话,第二步只能选 XVF3800 或 Flex

第二步:确定拾音方式与连接方式

按麦克风放在哪里选型号

麦克风形态标称拾音距离覆盖角度板载功放适用参考价
reSpeaker Lite桌面放置 · 双麦3 m180°5 W桌面近场,一两个人;转写、语音对话约 $25
reSpeaker XVF3800放置式 · 圆形四麦5 m360°5 W房间中间,多人;转写、对话、可打断对话约 $55
reSpeaker Flex Circular-4分体式 · 圆形四麦5 m360°10 W装进机器人或整机;对话、可打断对话约 $55
reSpeaker Flex Linear-4分体式 · 线形四麦5 m约 180°(抑制后方)10 W整机只需前向拾音约 $55
reSpeaker Clip佩戴式 · 双麦3 m360°巡检、外勤、门店导购;仅转写约 $76

四条选择规则:

  1. 多人围坐的房间,或需要可打断:选 XVF3800。360° 拾音,板上 AEC 与降噪,USB-C 一根线供电并传数据;对话式语音可部署方案默认使用它
  2. 麦克风要装进机器人或整机外壳:选 Flex。阵列板与处理板分体,经排线连接,阵列可放在外壳任意位置;只需前向拾音选 Linear-4。10 W 扬声器负载经板上外部 12 V 电源端子驱动
  3. 桌面一两个人,只做转写或不需要打断的对话:选 Lite
  4. 说话人要走动(巡检、外勤、导购):选 Clip。可脱离手机连续录音 14–18 小时,音频经手机 App 上传;只用于转写

按主机位置选连接方式

连接方式音频路径适用
USB 直连主机(免驱)麦克风 → USB → 算力盒子麦克风与算力盒子在同一位置;本文配置器的所有套餐均采用此方式
I2S + XIAO ESP32S3麦克风 → I2S → XIAO ESP32S3 → Wi-Fi → 服务器麦克风与主机不在同一位置,或整机只放一块 MCU
  • 麦克风与算力盒子在一处:用 USB 直连,购买不带 XIAO 的版本,出厂即可使用
  • 麦克风离主机远,或整机只放一块 MCU:购买带 XIAO ESP32S3 的版本,刷写 I2S 固件;服务端的音频接收与转写需自行部署,交付工作量高于 USB 路线。固件与示例工程见 reSpeaker XVF3800 Wiki
  • Clip 不走以上两种方式,音频经手机 App 上传

适用边界。 拾音距离与覆盖角度为规格值,现场实际距离受混响与噪声影响,核对方法见第四步。

第三步:确定哪些在本地,选算力档

本地范围选项

本地范围本地运行上传内容联网要求对应算力
上传云端转写(仅转写)音频持续联网不需要算力盒子
本地转写(仅转写)VAD · ASR每句最终转写文本上传文本时联网reRouter CM4 / reComputer RK3576
语音在本地,大模型用云端VAD · ASR · TTS识别出的文字持续联网reComputer RK3576 / RK3588
全部在本地(含大模型)VAD · ASR · TTS · 大模型首次启动后可断网reComputer J4012,或 RK3588 + NPU 扩展卡
全部走云端(对话)VAD 与音频收发音频持续联网reRouter CM4

各算力档实测

设备本地能跑SenseVoice 推荐并发路数p50 / p95对话语言本地大模型参考价
reRouter CM4VAD · ASR(CPU)仅适合 1–2 人单点;多点并发选 RK3576约 $246
reComputer RK3576VAD · ASR · TTS(NPU)12 路583 / 1067 ms中文、英文走云端约 $199
reComputer RK3588VAD · ASR · TTS(NPU)8 路659 / 902 ms30 种加 NPU 扩展卡运行 Qwen3-4B约 $279
reComputer J3011VAD · ASR · TTS(GPU)32 路167 / 293 ms30 种不在本板运行 4B 模型约 $699
reComputer J4012VAD · ASR · TTS · 大模型48 路505 / 789 ms30 种Qwen3.5-4B 同板约 $1299

测试条件:SenseVoice 模型,每条音频不超过 4 秒,p50 / p95 从 ASR 语音结束计时到最终结果,不含 VAD、上传与入库。准确率用同一份 100 条语料另行评估:中文 CER 在 4 台设备上均为 4.82%,英文 WER 在 7.50%–8.51% 之间。参考价为查询当时的整机参考价,以商品页为准。

四项选择规则:

  1. 仅转写、单点、一两个人:reRouter CM4 即可;多点或多路并发时选 reComputer RK3576
  2. 对话,大模型走云端:中文、英文选 reComputer RK3576;其他语言选 reComputer RK3588
  3. 对话,全部在本地:选 reComputer J4012;已采用 RK 平台的项目选 reComputer RK3588 + NPU 扩展卡(联系方案专家)
  4. 同一台设备还要跑视觉等 AI 负载:选 reComputer J3011,大模型走云端

适用边界。 上表为同一语料、同一 ASR 服务下的横向对照,用于确定选型区间,非验收指标。以下情况需在目标现场实测:单句音频明显长于 4 秒;需要把 VAD、上传与入库计入端到端时延;以英文或中英以外语言为主;用 reRouter CM4 做正式容量规划。

第四步:核对现场声学条件

算力选型成立的前提是麦克风拿到可识别的人声。判断顺序:先距离与噪声,再回声。

现场条件参考边界超出时的处理
说话人到麦克风的距离约 3 m 以内移近麦克风,或按区域增加麦克风;说话人走动时用 Clip
稳态背景噪声约 70 dB 以下调整麦克风朝向与位置,远离噪声源;上线前用现场录音测一遍识别准确率
设备自身播放回复(对话)麦克风板上 AEC 生效扬声器接在麦克风板上,使用 XVF3800 或 Flex

超过约 3 m 或稳态噪声高于约 70 dB 时,阵列难以分出说话人,词错率在算力发挥作用之前已经劣化。这两个边界来自零售语音转写可部署方案的适用说明,用作现场勘察的判断线,不是实测阈值。

可打断对话的验收方式:扬声器开到正常房间音量,在真实房间内连续三轮,每轮在回复开始后 0.5–1 秒插话,确认旧回复立即停止且插话内容没有丢失。低音量下通过验收的终端,在实际工作音量下可能因声学原因失败,与模型无关。


面向方案商与系统集成商:从验证到交付

若方案用于向下游客户交付,以下三项在选型阶段确认。

验证路径。 语音对话与可打断对话有可运行的可部署方案,可用于提案阶段搭建演示环境:见 对话式语音 AI

接入自有系统。 对话路线的对接点是 OpenAI 兼容的流式 Chat Completions 接口:把接口地址指向自有的 RAG 服务、工单或点单后台、机器人指令层,语音层不需修改。本地与云端大模型之间切换同样只改接口地址。转写路线把每句最终转写以文本形式上传到业务系统。

硬件定制与批量供货。 外壳、品牌标识、包装与接口改动可作为定制项目评估;reSpeaker Flex 的分体结构可按整机外壳布置阵列位置。具体定制范围、认证覆盖与交付周期见 ODM/OEM 定制服务

取数口径与对照范围

并发路数与准确率为 ASR 服务的实测值,不是端到端验收值。 计时从 ASR 语音结束开始,到最终结果为止;VAD、上传与入库均不在其中。语料为每条不超过 4 秒的短句,长句与连续对话场景的表现需另测。

设备数据取自 Seeed 自有产品线,从入门网关 reRouter CM4 到 reComputer J4012,同一 ASR 服务与同一份语料。只用单一产品线做横向对照,是因为跨厂商的语音并发数据测试条件往往不统一——模型、语料长度、计时起止点任一项不同,数字即不可比。本文的方法(先定交互方式,再定拾音与本地范围,最后核对现场声学条件)与具体品牌无关,换成其他厂商的设备同样适用。

数据来源与测试条件

  • SenseVoice 并发路数与 p50 / p95:OpenVoiceStream ASR 服务,SenseVoice;Jetson 并发语料 200 路、RK 并发语料 100 路,每条不超过 4 秒;计时从 ASR 语音结束到最终结果。出处:零售语音转写可部署方案工程文档
  • 准确率:同一份 100 条语料;中文 CER 4.82%(J3011、J4012、RK3576、RK3588 一致),英文 WER J4012 7.62%、J3011 7.62%、RK3576 8.51%、RK3588 7.50%
  • 对话语言:reComputer RK3576 为中文、英文;RK3588、J3011、J4012 为全部 30 种。出处:对话式语音 AI 可部署方案工程文档
  • 麦克风参数:拾音距离、覆盖角度与功放取自 Seeed Wiki 各型号页与产品页,均为标称值
  • 现场声学边界(约 3 m、约 70 dB):零售语音转写可部署方案工程文档的适用说明,为勘察判断线
  • 参考价格:Seeed 商品页价格,随配置与时间变动,以商品页为准

本文数据用于确定选型区间。正式交付前,建议在目标现场用真实麦克风与真实音量完成一轮实测,重点验证识别准确率、可打断行为与端到端时延。