同じ音声インタラクションでも、体験の差は「割り込めるか」一点に集中します。
ボタンを押して話す → 端末が答え終わるのを待つ → ようやく次の発話。訂正?長い読み上げが終わるまで待つだけ。騒がしい車間では特にストレス。
いつでも差し込み・割り込み・訂正——端末は自分の声も相手の声も聞き分け、テンポは同僚と話すようです。
まず端末が「自分を聞き」、次に「あなたを聞き」、最後にスケジューラが「誰が先に話すか」を決めます。
ニューラル VAD が 75dB の工場騒音下で「発話 / ポーズ / 騒音」を区別、誰が話し始めたかをミリ秒で感知——割り込みへの第一反応はクラウドではなく端末側から。
ミリ秒のローカル応答 · ネットワーク非依存
線形+非線形のデュアルフィルタ AEC が自機の再生エコーを除去、エコー抑制 40dB——端末は「自分が何を言っているか」を知り、自分の声を命令と誤認しません。
Espressif 2026 新世代全二重 AEC アルゴリズム
160ms の音響ウィンドウで対話状態(聴取 / 発話 / ポーズ / 待機)を継続判定、ターン判定は約 250ms——「考え中」と「話し終わり」を区別し、真人のようなテンポ。
Soul AI × 上海交通大学 × 西北工業大学 共同オープンソース · Apache-2.0 · 数億ユーザーの音声技術
5 分の実機デモは、10 ページの資料より確かです。