同样是语音交互,体验差距发生在「能不能插话」这一件事上。
按住说话 → 等设备答完 → 才能再说。想纠正?等它念完一长串。嘈杂车间里体验尤其糟糕。
随时插话、随时打断、随时纠错——设备听得见自己、也听得见你,交互节奏和同事对话一样自然。
端侧先「听见自己」,再「听见你」,最后由调度层决定「谁先说」。
神经网络级 VAD,在 75dB 车间噪音中区分「说话 / 停顿 / 噪音」,毫秒级感知谁在开口——打断的第一反应来自端侧,不等云端。
毫秒级本地响应 · 不依赖网络
双滤波 AEC(线性 + 非线性)消除设备自身播报的回声,回声抑制达 40dB——设备「知道自己正在说什么」,不会把自己的话当成用户指令。
乐鑫 2026 新一代全双工 AEC 算法
以 160ms 声学窗口持续判断对话状态(倾听 / 说话 / 停顿 / 待机),轮次判定仅 ~250ms——分清「想好了再说」与「说完了」,对话节奏如真人。
Soul AI × 上海交通大学 × 西北工业大学联合开源 · Apache-2.0 · 亿级用户语音场景技术沉淀
现场演示 5 分钟,胜过十页参数表。