収音から「アップロードすべきか」まで端側で一括処理——クラウドが受け取るのは認識に値する音声だけ。
ブランド独自のウェイクワード、TTS 合成トレーニングパイプライン、精度は実人声録音の 95–98%。
→AEC エコーキャンセル+ノイズ除去+アレイビームフォーミングで騒音下でも人声を捕捉。
→ニューラル VAD が発話とポーズをミリ秒単位で区別。
→断網時も 30 のローカルコマンドで即応、ラインが「聞こえなくなる」ことはありません。
→暗号化 WebSocket、クラウドの大モデル級認識。
EBOX は LLM アーキテクチャの新世代オープンソース認識モデルを採用。
| モデル | 主要言語 | 特徴 | 遅延 |
|---|---|---|---|
| Qwen3-ASR-1.7BEBOX 採用 | 30 言語+22 方言 中/英/日/韓/越/タイ/独/西/葡/インドネシア全対応 | LLM アーキテクチャ認識;1万トークン級の業界ホットワード偏置、品目番号・ロット番号はマニアックなほど効く;CPU のみでリアルタイム推論、GPU 不要 | 話しながらストリーミング認識 0.1–0.3s / 毎秒オーディオ 言い終わると全文が出る |
| 従来型ローカル ASR Paraformer 系 | 中/英中心 | アーキテクチャは成熟、ただし多言語対応が少なくホットワード拡張も弱い | 速いが言語が限られる |
| Whisper | 90+ 言語 | 汎用性は高い;ホットワード機構なし、ハルシネーションリスク、計算資源重い | CPU ではリアルタイム困難 |
| クラウド API | 対応広い | 外部ネットワーク依存、音声データが工場外へ、従量課金が続く | ネットワーク変動の影響 |
ローカル合成エンジン、ライセンスはクリーン、クラウド非依存。
| モデル | 主要言語 | 特徴 | 遅延 |
|---|---|---|---|
| Piper / VITS ローカル合成EBOX 採用 | 60+ 言語 ベトナム語 3 音色を先行搭載 | 完全ローカル CPU 合成、MIT 系ライセンスで商用安心;統一ランタイムで言語ごとにエンジン拡張;数字・ロケーション番号の読み規範レイヤーで播報の曖昧さゼロ | 初回パケット 100–300ms ストリーミング再生、生成しながら話す |
| MeloTTS | 6 言語 | CPU リアルタイム、日英混読、多言語バックアップエンジン | リアルタイム |
| クラウド TTS | 140+ 言語 | 音質は良いが要ネット、工業イントラでは使えない | ネットワーク RTT の影響 |
デモ予約の際、業界ホットワードをお持ちください。