EBOX × EAR CLOUD EAR CLOUD
ホーム / コア技術 / エッジAI音声アルゴリズム

エッジ音声アルゴリズム:正しく聞こえてこそ、正しく答えられる

工場現場の第一関門は端末チップ上で完結:ウェイク・ノイズ除去・検出はすべてローカル動作、有効な音声のみを上流へ——耐騒音・帯域節約・プライバシー保護。

WakeNet10 ウェイク端側 2–3ms/フレームMultiNet オフライン代替
PIPELINE · 端側チェーン

5 ステップ、すべて端末チップ上で

収音から「アップロードすべきか」まで端側で一括処理——クラウドが受け取るのは認識に値する音声だけ。

WakeNet10 ウェイク

ブランド独自のウェイクワード、TTS 合成トレーニングパイプライン、精度は実人声録音の 95–98%。

AFE 音声フロントエンド

AEC エコーキャンセル+ノイズ除去+アレイビームフォーミングで騒音下でも人声を捕捉。

VADNet 検出

ニューラル VAD が発話とポーズをミリ秒単位で区別。

MultiNet オフライン代替

断網時も 30 のローカルコマンドで即応、ラインが「聞こえなくなる」ことはありません。

音声ストリーム上流

暗号化 WebSocket、クラウドの大モデル級認識。

ASR COMPARISON

ASR 音声認識 · 選定比較

EBOX は LLM アーキテクチャの新世代オープンソース認識モデルを採用。

モデル主要言語特徴遅延
Qwen3-ASR-1.7BEBOX 採用30 言語+22 方言
中/英/日/韓/越/タイ/独/西/葡/インドネシア全対応
LLM アーキテクチャ認識;1万トークン級の業界ホットワード偏置、品目番号・ロット番号はマニアックなほど効く;CPU のみでリアルタイム推論、GPU 不要話しながらストリーミング認識
0.1–0.3s / 毎秒オーディオ
言い終わると全文が出る
従来型ローカル ASR
Paraformer 系
中/英中心アーキテクチャは成熟、ただし多言語対応が少なくホットワード拡張も弱い速いが言語が限られる
Whisper90+ 言語汎用性は高い;ホットワード機構なし、ハルシネーションリスク、計算資源重いCPU ではリアルタイム困難
クラウド API対応広い外部ネットワーク依存、音声データが工場外へ、従量課金が続くネットワーク変動の影響
TTS COMPARISON

TTS 音声合成 · 選定比較

ローカル合成エンジン、ライセンスはクリーン、クラウド非依存。

モデル主要言語特徴遅延
Piper / VITS ローカル合成EBOX 採用60+ 言語
ベトナム語 3 音色を先行搭載
完全ローカル CPU 合成、MIT 系ライセンスで商用安心;統一ランタイムで言語ごとにエンジン拡張;数字・ロケーション番号の読み規範レイヤーで播報の曖昧さゼロ初回パケット 100–300ms
ストリーミング再生、生成しながら話す
MeloTTS6 言語CPU リアルタイム、日英混読、多言語バックアップエンジンリアルタイム
クラウド TTS140+ 言語音質は良いが要ネット、工業イントラでは使えないネットワーク RTT の影響
95–98%
ウェイクモデル精度(実人声録音と対照して学習)
2–3 ms
端側の毎フレーム処理時間
30
断網時のオフライン命令即時対応
0
誤ウェイク音声の上流(端側でサイレント濾過)
次のページ:全二重音声対話

このアルゴリズムたちを現場で試してみませんか?

デモ予約の際、業界ホットワードをお持ちください。