Terminal giọng nói truyền thống là bán song công — bạn không thể chen ngang khi máy đang nói. EBOX dùng ba tầng công nghệ để đạt song công thật, ngắt lời được: nhân viên chen ngang bất cứ lúc nào khi máy phát, máy im trong 100ms để nghe bạn.
Cùng là tương tác giọng nói, nhưng khác biệt trải nghiệm nằm đúng một chỗ: có chen ngang được không.
Giữ nút để nói → chờ máy trả lời xong → mới nói tiếp. Muốn sửa? Đợi nó đọc hết cả dãy. Càng ồn trong xưởng càng khổ.
Chen ngang, ngắt lời, sửa lời — lúc nào cũng được. Máy nghe thấy cả mình lẫn bạn; nhịp trò chuyện như nói với đồng nghiệp.
Trước tiên máy "nghe thấy chính mình", rồi "nghe thấy bạn", cuối cùng tầng điều phối quyết định "ai nói trước".
VAD mạng nơ-ron phân biệt nói / ngắt / ồn trong tiếng ồn xưởng 75dB, cảm nhận ai đang nói ở mức mili-giây — phản ứng đầu tiên trước ngắt lời đến từ thiết bị, không chờ đám mây.
Phản hồi cục bộ mili-giây · không phụ thuộc mạng
AEC lọc kép tuyến tính + phi tuyến triệt tiếng vang do máy tự phát, khử vang tới 40dB — máy biết mình đang nói gì, không nhầm giọng mình thành lệnh người dùng.
Thuật toán AEC song công thế hệ mới Espressif 2026
Cửa sổ âm học 160ms liên tục phán đoán trạng thái (nghe / nói / ngắt / chờ), quyết định lượt chỉ ~250ms — phân biệt đang nghĩ và đã nói xong, nhịp như người thật.
Mã nguồn mở bởi Soul AI × ĐH Giao thông Thượng Hải × ĐH Bách khoa Tây Bắc · Apache-2.0
5 phút demo tại chỗ, hơn mười trang thông số.