Chốt chặn đầu tiên tại hiện trường công nghiệp nằm ngay trên chip thiết bị: đánh thức, khử ồn, phát hiện đều chạy cục bộ, chỉ giọng nói hợp lệ được đẩy lên — chống ồn, tiết kiệm băng thông, bảo vệ riêng tư.
Từ thu âm đến "có nên đẩy lên không" — thiết bị xử lý trọn một lượt; đám mây chỉ nhận giọng nói đáng nhận diện.
Từ đánh thức tùy biến theo thương hiệu, pipeline huấn luyện bằng tổng hợp TTS, độ chính xác 95–98% so với ghi âm người thật.
→AEC triệt tiếng vang + khử ồn + beamforming mảng mic, bắt trúng giọng người giữa tiếng ồn.
→VAD mạng nơ-ron phân biệt nói và ngắt ở mức mili-giây.
→Mất mạng vẫn có 30 lệnh cục bộ phản hồi tức thì — dây chuyền không bao giờ điếc.
→WebSocket mã hóa, nhận diện cấp mô hình lớn trên mây.
EBOX dùng mô hình nhận diện mã nguồn mở thế hệ mới kiến trúc LLM.
| Phương án | Ngôn ngữ chính | Đặc điểm | Độ trễ |
|---|---|---|---|
| Qwen3-ASR-1.7BEBOX lựa chọn | 30 ngôn ngữ + 22 phương ngữ Trung Trung/Anh/Nhật/Hàn/Việt/Thái/Đức/Tây/Bồ/Indo đủ cả | Nhận diện kiến trúc LLM; thiên lệch hotword ngành vạn token — mã vật tư, mã lô càng lạ càng hiệu quả; suy luận thời gian thực trên CPU thuần, không cần GPU | Nhận diện streaming vừa nói vừa nhận 0.1–0.3s / mỗi giây âm thanh nhắc xong là có văn bản đầy đủ |
| ASR cục bộ truyền thống nhóm Paraformer | Chủ yếu Trung/Anh | Kiến trúc chín, nhưng ít ngôn ngữ và yếu mở rộng hotword | Nhanh, nhưng hạn chế ngôn ngữ |
| Whisper | 90+ ngôn ngữ | Tổng quát tốt; không có cơ chế hotword, có nguy cơ ảo giác, tốn tính toán | Khó real-time trên CPU |
| API đám mây | Phủ rộng | Phụ thuộc mạng ngoài, dữ liệu giọng nói ra khỏi nhà máy, trả phí theo lượng dài hạn | Chịu ảnh hưởng biến động mạng |
Engine tổng hợp cục bộ, giấy phép sạch, không phụ thuộc đám mây.
| Phương án | Ngôn ngữ chính | Đặc điểm | Độ trễ |
|---|---|---|---|
| Piper / VITS tổng hợp cục bộEBOX lựa chọn | 60+ ngôn ngữ Tiếng Việt 3 giọng ra mắt đầu tiên | Tổng hợp CPU hoàn toàn cục bộ, giấy phép nhóm MIT yên tâm thương mại; một runtime mở rộng engine theo từng ngôn ngữ; lớp chuẩn hóa cách đọc số / mã vị trí trước — phát âm thanh không mơ hồ | Gói đầu 100–300ms phát streaming, nói khi vừa sinh |
| MeloTTS | 6 ngôn ngữ | CPU real-time, đọc trộn Trung-Anh, engine dự phòng đa ngôn ngữ | Real-time |
| TTS đám mây | 140+ ngôn ngữ | Âm thanh đẹp nhưng cần mạng — nội bộ công nghiệp không dùng được | Chịu ảnh hưởng RTT mạng |
Đặt demo — mang hotword ngành hàng của bạn đến thử.