EBOX × EAR CLOUD EAR CLOUD
首页 / 核心技术 / 双工对话

双工对话技术:像打电话,不像对讲机

传统语音终端是半双工——设备说话时你插不上话。EBOX 用三层技术实现真正的全双工可打断:设备播报时员工随时抢话,设备 100ms 内安静下来听你说。

SoulX-DuplugAEC 40dB≤100ms 打断
现场对话 · 全双工演示 SoulX-Duplug
聆听中 · 可随时打断 ···
HALF vs FULL DUPLEX

从「对讲机」到「打电话」

同样是语音交互,体验差距发生在「能不能插话」这一件事上。

旧方式

传统:半双工(对讲机式)

按住说话 → 等设备答完 → 才能再说。想纠正?等它念完一长串。嘈杂车间里体验尤其糟糕。

EBOX 方式

EBOX:全双工(对话式)

随时插话、随时打断、随时纠错——设备听得见自己、也听得见你,交互节奏和同事对话一样自然。

THREE LAYERS

三层技术,撑起真正的全双工

端侧先「听见自己」,再「听见你」,最后由调度层决定「谁先说」。

VAD

语音活动检测 · VADNet

神经网络级 VAD,在 75dB 车间噪音中区分「说话 / 停顿 / 噪音」,毫秒级感知谁在开口——打断的第一反应来自端侧,不等云端。

毫秒级本地响应 · 不依赖网络

AEC

声学回声消除 · 工业级

双滤波 AEC(线性 + 非线性)消除设备自身播报的回声,回声抑制达 40dB——设备「知道自己正在说什么」,不会把自己的话当成用户指令。

乐鑫 2026 新一代全双工 AEC 算法

Duplug

全双工轮次调度 · SoulX-Duplug

以 160ms 声学窗口持续判断对话状态(倾听 / 说话 / 停顿 / 待机),轮次判定仅 ~250ms——分清「想好了再说」与「说完了」,对话节奏如真人。

Soul AI × 上海交通大学 × 西北工业大学联合开源 · Apache-2.0 · 亿级用户语音场景技术沉淀

BARGE-IN TIMELINE

一次打断是怎么发生的

设备播报答案中员工突然开口
≤100ms 静音立即停下,不抢话
重新倾听听完整句,理解意图
秒级重新作答新答案无缝接上
插话、抢话、纠错——全部自然发生。这是「对话」,不是「按键对讲」。
160 ms
全双工轮次感知窗口
~250 ms
轮次判定耗时
≤100 ms
打断静音响应
75 dB
车间噪声下仍可听清
下一篇:软硬一体

想体验「随时打断」的对话感?

现场演示 5 分钟,胜过十页参数表。