Trang chủ › Nhận dạng giọng nói tiếng Việt
Tiếng Việt trong thực tế
Nhận dạng giọng nói tiếng Việt có chuẩn không?
Trước khi trả tiền cho một phần mềm gỡ băng, người dùng Việt hỏi đúng một câu: nó nghe tiếng Việt có ra không? Câu hỏi chính đáng, vì nhiều công cụ ưu tiên tiếng Anh trả về tiếng Việt sai dấu và sai tên riêng. Bài này nói thẳng về những chỗ máy hay sai — dấu thanh, ranh giới âm tiết, giọng ba miền, thói quen chèn tiếng Anh — và chỉ cách bạn tự kiểm chứng bằng chính bản ghi của mình.
Trả lời ngắn trước
Có, tiếng Việt là một trong 99 ngôn ngữ ứng dụng nhận dạng, và với bản ghi sạch — một người nói, micro gần, phòng yên tĩnh — kết quả đủ tốt để bạn biên tập thay vì gõ lại từ đầu. Nhưng bản máy tạo ra là bản nháp, và tiếng Việt có mấy chỗ sai đặc thù nên biết trước để bố trí thời gian soát.
Chúng tôi không đưa ra con số phần trăm độ chính xác vì chưa có phép đo nào đủ chuẩn để công bố — và con số đo trong phòng thu chẳng nói lên điều gì về phòng họp của bạn. Phần cuối bài chỉ cách tự kiểm chứng bằng chính bản ghi của bạn, miễn phí.
Dấu thanh: chỗ sai gây hậu quả nhất
Tiếng Việt có sáu thanh điệu và bộ dấu huyền, sắc, hỏi, ngã, nặng. Thanh điệu mang nghĩa, nên một dấu sai không tạo ra lỗi chính tả nhẹ mà đổi hẳn nghĩa câu: "má" và "mà", "bàn" và "bán", "sửa" và "sữa", "chở" và "chợ". Trong bản gỡ băng dài, một chữ "ký" thành "kỳ" hay "giá" thành "già" đủ làm câu trở nên vô nghĩa hoặc tệ hơn là có nghĩa nhưng sai.
Hai lỗi hay gặp nhất:
- Mất dấu khi người nói nói nhanh, nói nhỏ hoặc cuối câu xuống giọng. Âm cuối câu thường là chỗ mất dấu nhiều nhất.
- Lẫn hỏi với ngã — ngay cả người Việt viết cũng hay lẫn, và ở nhiều vùng hai thanh này gần như phát âm giống nhau, nên máy không có căn cứ để phân biệt.
Cách soát: đọc lướt tìm những chữ đúng chính tả nhưng sai ngữ cảnh — gần như luôn là lỗi dấu. Công cụ kiểm tra chính tả không bắt được, vì "sửa" và "sữa" đều hợp lệ.
Ranh giới từ và mấy chữ chỉ tiếng Việt mới có
Tiếng Việt viết rời từng âm tiết nên máy phải tự đoán chỗ nào là một từ, và ranh giới từ hay bị cắt hoặc ghép sai — "hoà bình" tách thành "hoà" và "bình" ở hai vế khác nhau. Đọc thì vẫn hiểu, nhưng nếu bạn định tìm kiếm theo cụm từ trong kho bản gỡ băng thì đây là chỗ làm bạn hụt kết quả.
Chuyện thứ hai mang tính kỹ thuật: các chữ ă, â, đ, ê, ô, ơ, ư có thể được mã hoá theo hai cách khác nhau trong Unicode — chữ "ế" dựng sẵn, hoặc "ê" cộng dấu sắc rời. Nhìn giống hệt, nhưng khi dán sang phần mềm khác hoặc tìm kiếm thì có thể không khớp. Gặp hiện tượng "rõ ràng có chữ đó mà tìm không ra" thì đây thường là nguyên nhân.
Giọng Bắc, Trung, Nam
Đây là chỗ nhiều bài quảng cáo né tránh, nên nói thẳng: kết quả không đều nhau giữa các vùng.
| Giọng | Thường gặp |
|---|---|
| Giọng chuẩn miền Bắc (Hà Nội), giọng phát thanh | Ổn nhất — mô hình học nhiều nhất từ nguồn dạng này |
| Giọng Sài Gòn và Nam Bộ nói chung | Cũng khá ổn; hay sai ở các âm cuối và cặp phụ âm đầu v/d, n/ng |
| Giọng Huế và Quảng Nam, Quảng Ngãi | Tỉ lệ lỗi cao hơn thấy rõ, nhất là ở thanh điệu và nguyên âm |
| Giọng Nghệ An, Hà Tĩnh | Khó nhất trong các vùng phổ biến — khác biệt cả thanh điệu lẫn từ vựng địa phương |
| Từ địa phương (mô, tê, răng, rứa, chi) | Hay bị viết thành từ toàn dân gần âm |
Nếu bạn phỏng vấn ở miền Trung hoặc gỡ băng cuộc gọi bán hàng với khách khắp cả nước, hãy tính trước một vòng soát dày hơn. Còn nếu bản ghi chủ yếu là họp nội bộ ở Hà Nội hay TP.HCM thì dấu thanh mới là chỗ tốn thời gian nhất, không phải giọng vùng.
Chèn tiếng Anh giữa câu — chuyện của dân văn phòng Việt Nam
Không ai nói "hạn chót" nữa, người ta nói "deadline". Chúng ta "book lịch", "check lại", "ship hàng", "gửi brief", "xin feedback", "set up cái meeting". Một cuộc họp marketing hay công nghệ ở Việt Nam là văn bản trộn hai ngôn ngữ, và đây là điểm mà các công cụ chỉ tối ưu cho một ngôn ngữ hay vấp.
Cơ chế cần biết: việc nhận diện ngôn ngữ được quyết định theo từng bản ghi, không đổi qua đổi lại giữa chừng. Nghĩa là:
- Vài từ tiếng Anh lẻ tẻ trong câu tiếng Việt — thường không sao, chúng được viết ra dạng tiếng Anh hoặc phiên gần đúng.
- Cả một đoạn dài toàn tiếng Anh giữa cuộc họp tiếng Việt — đây mới là chỗ kết quả rối, vì máy đã chốt ngôn ngữ cho bản ghi đó.
- Cách xử lý — vào cài đặt mô hình và thu hẹp danh sách ngôn ngữ ưu tiên còn Tiếng Việt và Tiếng Anh, để máy khỏi đoán sang ngôn ngữ thứ ba khi nghe những từ mượn. Thao tác cụ thể nằm ở cách chuyển giọng nói thành văn bản trên Mac.
- Nếu buổi họp chia hai nửa rõ rệt, nửa đầu tiếng Việt nửa sau tiếng Anh, hãy tách thành hai bản ghi.
Tên riêng, số hiệu văn bản và con số
Nhóm lỗi bạn gần như chắc chắn phải sửa tay, ở mọi phần mềm chứ không riêng gì cái nào:
- Tên người — Nguyễn, Huỳnh, Đặng, Trịnh, Vũ hay bị viết sai, và cùng một cái tên có thể ra khác nhau ở hai chỗ trong cùng bản gỡ băng.
- Tên công ty và tên viết tắt — nhất là tên trộn tiếng Anh.
- Số hiệu văn bản kiểu "Nghị định 15/2020/NĐ-CP" — dấu gạch chéo và phần chữ cái cuối rất hay sai.
- Con số đọc bằng lời — "một triệu hai", "hai trăm rưỡi", "ba phẩy năm" có thể ra chữ thay vì ra số, hoặc ra số sai.
- Thuật ngữ ngành — y tế, xây dựng, tài chính, pháp lý đều có kho từ mô hình phổ thông nghe không quen.
Mẹo: dùng tìm và thay thế cho những tên lặp lại nhiều lần, sửa một lần cho cả bản.
Micro và tiếng ồn quan trọng với tiếng Việt hơn bạn nghĩ
Thông tin thanh điệu nằm ở cao độ giọng nói, mà cao độ là thứ dễ mất nhất khi âm thanh bị nén mạnh, bị vọng hoặc lẫn ồn. Cùng một mức nhiễu, tiếng Việt chịu thiệt hơn các ngôn ngữ không có thanh điệu — mất dấu là mất nghĩa.
Cụ thể: bản ghi cuộc gọi phát qua loa ngoài rồi thu lại bằng micro là nguồn tệ nhất; phỏng vấn trong quán cà phê tệ nhì; máy ghi âm để giữa bàn họp đông người làm người ngồi xa gần như mất tiếng. Ngược lại, một chiếc tai nghe có micro loại thường cũng đã cải thiện rõ rệt.
Cách tự kiểm chứng trong mười lăm phút
Đừng tin bài trên trang bán hàng, kể cả bài này. Cách duy nhất trả lời được câu "nó nghe tiếng Việt của tôi có ra không" là thử bằng chính bản ghi của bạn. Gợi ý bộ mẫu:
- Một bản ghi sạch: bạn nói một mình vào micro, phòng yên tĩnh, khoảng hai phút. Đây là mức trần.
- Một bản ghi thật: một cuộc họp hoặc cuộc gọi điển hình của công việc bạn, đủ ồn, đủ nhiều người. Đây là mức thật sự đáng quan tâm.
- Một bản ghi khó: giọng vùng miền, hoặc đoạn có nhiều thuật ngữ ngành, hoặc file cũ chất lượng thấp. Đây là mức sàn.
Ba file đó nằm gọn trong hạn mức miễn phí. Tải ứng dụng từ Mac App Store miễn phí: bản miễn phí cho gỡ băng tổng cộng 5 file audio và 5 file video — trọn đời, không phải mỗi ngày — cùng 5 phút nhập liệu bằng giọng nói mỗi ngày. Ghi âm thì không giới hạn, và gỡ băng lại một bản đã gỡ rồi thì không tốn thêm lượt, nên bạn thử lại với cài đặt ngôn ngữ khác nhau thoải mái. Thấy dùng được thì mở khoá Pro trong ứng dụng: 49,99 $ trả một lần, không phải thuê bao (khoảng 1,2–1,3 triệu ₫ — đây là ước tính, số tiền thật hiển thị trên App Store Việt Nam). Cấu hình: macOS 13 (Ventura) trở lên, Apple Silicon (M1 trở lên) bắt buộc, máy Mac chip Intel không chạy được.
Nếu bản ghi thử của bạn có giọng người khác, hãy xin phép họ trước — nói ngay đầu buổi "mình xin phép ghi âm để làm biên bản" là cách quen thuộc và an toàn nhất. Điều 38 Bộ luật Dân sự 2015 quy định việc thu thập, lưu giữ, sử dụng thông tin về đời sống riêng tư, bí mật cá nhân của người khác phải được người đó đồng ý. Đây là thông tin tham khảo, không phải tư vấn pháp lý.
Tải miễn phí — bản miễn phí có giới hạn. Không thuê bao. · Mở khoá Pro 49,99 $, trả một lần · macOS 13 trở lên
Câu hỏi thường gặp
Gỡ băng tiếng Việt có chính xác không?
Với bản ghi sạch — một người nói, micro gần, phòng yên tĩnh — kết quả đủ tốt để bạn biên tập thay vì gõ lại từ đầu. Nhưng đây là bản nháp: dấu thanh, tên riêng và thuật ngữ chuyên ngành là những chỗ cần soát tay. Chúng tôi không công bố con số phần trăm độ chính xác vì chưa có phép đo đủ chuẩn để công bố.
Vì sao bản gỡ băng hay sai dấu thanh?
Vì thanh điệu nằm ở cao độ giọng nói, mà cao độ là thứ dễ mất nhất khi âm thanh bị nén mạnh, bị vọng hoặc lẫn tiếng ồn. Hai lỗi phổ biến nhất là mất dấu ở cuối câu khi người nói xuống giọng, và lẫn giữa thanh hỏi với thanh ngã. Khi soát, hãy để ý những chữ đúng chính tả nhưng sai ngữ cảnh.
Giọng miền Trung có nhận dạng được không?
Được, nhưng tỉ lệ lỗi cao hơn thấy rõ so với giọng chuẩn miền Bắc và giọng Sài Gòn, vì giọng Huế, Quảng Nam, Nghệ An và Hà Tĩnh khác biệt cả về thanh điệu lẫn từ vựng. Từ địa phương như mô, tê, răng, rứa hay bị viết thành từ toàn dân gần âm. Nếu công việc của bạn chủ yếu là giọng miền Trung, hãy tính trước một vòng soát dày hơn.
Tôi hay nói chen tiếng Anh giữa câu thì có sao không?
Vài từ tiếng Anh lẻ tẻ như deadline, feedback, meeting thường không gây vấn đề. Cả một đoạn dài toàn tiếng Anh mới làm kết quả rối, vì việc nhận diện ngôn ngữ được quyết định theo từng bản ghi chứ không đổi giữa chừng. Cách xử lý là thu hẹp danh sách ngôn ngữ ưu tiên còn Tiếng Việt và Tiếng Anh trong cài đặt mô hình.
Có cần kết nối Internet để gỡ băng tiếng Việt không?
Không, trừ lần tải mô hình nhận dạng đầu tiên. Sau đó việc nhận dạng chạy bằng GPU của chính máy Mac, nên file không rời khỏi máy và ứng dụng chạy được cả khi bạn ở chế độ máy bay hoặc dùng mạng nội bộ chặn dịch vụ nước ngoài.
Làm sao thử trước khi mua?
Tải ứng dụng miễn phí rồi chạy thử ba bản ghi của chính bạn: một bản sạch, một bản họp thật, một bản khó. Bản miễn phí cho gỡ băng tổng cộng 5 file audio và 5 file video, tính trọn đời chứ không phải mỗi ngày, cùng 5 phút nhập liệu bằng giọng nói mỗi ngày; ghi âm không giới hạn và gỡ băng lại một bản đã gỡ thì không tốn thêm lượt. Thấy dùng được thì mở khoá Pro với 49,99 $ trả một lần, không phải thuê bao.