从收音到「该不该上传」,端侧一次做完——云端只收到值得识别的语音。
品牌自定义唤醒词,TTS 合成训练管线,精度达真人录音 95–98%。
→AEC 回声消除 + 降噪 + 阵列波束成形,噪音中锁定人声。
→神经网络 VAD,毫秒级区分说话与停顿。
→断网时 30 条本地指令直达,产线永不失聪。
→加密 WebSocket,云端大模型级识别。
EBOX 采用 LLM 架构新一代开源识别模型。
| 方案 | 主要语音 | 特点 | 延时 |
|---|---|---|---|
| Qwen3-ASR-1.7BEBOX 采用 | 30 语种 + 22 方言 中/英/日/韩/越/泰/德/西/葡/印尼全覆盖 | LLM 架构识别;万级 token 行业热词偏置,物料号、批次号越偏门越有效;纯 CPU 服务器实时推理,无 GPU 依赖 | 流式边说边识别 0.1–0.3s / 每秒音频 说完即出全文 |
| 传统本地 ASR Paraformer 类 | 中/英为主 | 架构成熟,但多语种覆盖少、热词扩展能力弱 | 快,但语种受限 |
| Whisper | 90+ 语种 | 通用性强;无热词机制、有幻觉风险、算力需求重 | CPU 上难以实时 |
| 云端 API | 覆盖广 | 依赖外网、语音数据出厂房、按量长期付费 | 受网络波动影响 |
本地合成引擎,许可干净、无云端依赖。
| 方案 | 主要语音 | 特点 | 延时 |
|---|---|---|---|
| Piper / VITS 本地合成EBOX 采用 | 60+ 语种 越南语 3 音色首发 | 完全本地 CPU 合成,MIT 系许可商用无忧;统一运行时按语种扩展引擎;前置数字 / 库位号读法规范层,播报零歧义 | 首包 100–300ms 流式播报,边生成边开口 |
| MeloTTS | 6 语种 | CPU 实时、中英混读,多语种拼盘备选引擎 | 实时 |
| 云端 TTS | 140+ 语种 | 音质好但依赖联网,工业内网不可用 | 受网络 RTT 影响 |
预约演示,带上你的行业热词来现场试。