EBOX × EAR CLOUD EAR CLOUD
ホーム / コア技術 / 全二重音声対話

全二重対話:電話のように、トランシーバーのようにはしない

従来の音声端末は半二重——端末が話している間は割り込めません。EBOX は三層技術で真の全二重・割り込み可能を実現:再生中でも従業員がいつでも割り込み、端末は 100ms 以内に静まって聞き始めます。

SoulX-DuplugAEC 40dB≤100ms 割り込み
現場対話 · 全二重デモ SoulX-Duplug
聴取中 · いつでも割り込み可 ···
半二重 vs 全二重

「トランシーバー」から「電話」へ

同じ音声インタラクションでも、体験の差は「割り込めるか」一点に集中します。

従来

従来:半二重(トランシーバー式)

ボタンを押して話す → 端末が答え終わるのを待つ → ようやく次の発話。訂正?長い読み上げが終わるまで待つだけ。騒がしい車間では特にストレス。

EBOX 方式

EBOX:全二重(対話式)

いつでも差し込み・割り込み・訂正——端末は自分の声も相手の声も聞き分け、テンポは同僚と話すようです。

THREE LAYERS

三層技術が真の全二重を支える

まず端末が「自分を聞き」、次に「あなたを聞き」、最後にスケジューラが「誰が先に話すか」を決めます。

VAD

音声活動検出 · VADNet

ニューラル VAD が 75dB の工場騒音下で「発話 / ポーズ / 騒音」を区別、誰が話し始めたかをミリ秒で感知——割り込みへの第一反応はクラウドではなく端末側から。

ミリ秒のローカル応答 · ネットワーク非依存

AEC

音響エコーキャンセル · 工業級

線形+非線形のデュアルフィルタ AEC が自機の再生エコーを除去、エコー抑制 40dB——端末は「自分が何を言っているか」を知り、自分の声を命令と誤認しません。

Espressif 2026 新世代全二重 AEC アルゴリズム

Duplug

全二重ターン制御 · SoulX-Duplug

160ms の音響ウィンドウで対話状態(聴取 / 発話 / ポーズ / 待機)を継続判定、ターン判定は約 250ms——「考え中」と「話し終わり」を区別し、真人のようなテンポ。

Soul AI × 上海交通大学 × 西北工業大学 共同オープンソース · Apache-2.0 · 数億ユーザーの音声技術

BARGE-IN タイムライン

割り込みはこう起こる

端末が回答を読み上げ中従業員が突然発話
≤100ms ミュート即座に静まり、声を重ねない
再度聴取一文を最後まで聞き、意図を理解
数秒で再回答新しい回答がシームレスに接続
差し込み・被せ・訂正——すべて自然に成立。これは「対話」であり、「押して話す」ではありません。
160 ms
全二重ターン感知ウィンドウ
~250 ms
ターン判定時間
≤100 ms
割り込みミュート応答
75 dB
工場騒音下でも聴き取る
次のページ:ソフト・ハード一体

「いつでも割り込める」体験を試してみますか?

5 分の実機デモは、10 ページの資料より確かです。