Trang chủ › Nhận dạng giọng nói tiếng Việt

Tiếng Việt trong thực tế

Nhận dạng giọng nói tiếng Việt có chuẩn không?

Trước khi trả tiền cho một phần mềm gỡ băng, người dùng Việt hỏi đúng một câu: nó nghe tiếng Việt có ra không? Câu hỏi chính đáng, vì nhiều công cụ ưu tiên tiếng Anh trả về tiếng Việt sai dấu và sai tên riêng. Bài này nói thẳng về những chỗ máy hay sai — dấu thanh, ranh giới âm tiết, giọng ba miền, thói quen chèn tiếng Anh — và chỉ cách bạn tự kiểm chứng bằng chính bản ghi của mình.

100%xử lý ngay trên máy — âm thanh không tải lên đâu cả
Miễn phítải về — mở khoá Pro 49,99 $, trả một lần
99ngôn ngữ, tự động nhận diện
macOS 13+Apple Silicon (M1 trở lên)

Trả lời ngắn trước

Có, tiếng Việt là một trong 99 ngôn ngữ ứng dụng nhận dạng, và với bản ghi sạch — một người nói, micro gần, phòng yên tĩnh — kết quả đủ tốt để bạn biên tập thay vì gõ lại từ đầu. Nhưng bản máy tạo ra là bản nháp, và tiếng Việt có mấy chỗ sai đặc thù nên biết trước để bố trí thời gian soát.

Chúng tôi không đưa ra con số phần trăm độ chính xác vì chưa có phép đo nào đủ chuẩn để công bố — và con số đo trong phòng thu chẳng nói lên điều gì về phòng họp của bạn. Phần cuối bài chỉ cách tự kiểm chứng bằng chính bản ghi của bạn, miễn phí.

Dấu thanh: chỗ sai gây hậu quả nhất

Tiếng Việt có sáu thanh điệu và bộ dấu huyền, sắc, hỏi, ngã, nặng. Thanh điệu mang nghĩa, nên một dấu sai không tạo ra lỗi chính tả nhẹ mà đổi hẳn nghĩa câu: "má" và "mà", "bàn" và "bán", "sửa" và "sữa", "chở" và "chợ". Trong bản gỡ băng dài, một chữ "ký" thành "kỳ" hay "giá" thành "già" đủ làm câu trở nên vô nghĩa hoặc tệ hơn là có nghĩa nhưng sai.

Hai lỗi hay gặp nhất:

Cách soát: đọc lướt tìm những chữ đúng chính tả nhưng sai ngữ cảnh — gần như luôn là lỗi dấu. Công cụ kiểm tra chính tả không bắt được, vì "sửa" và "sữa" đều hợp lệ.

Ranh giới từ và mấy chữ chỉ tiếng Việt mới có

Tiếng Việt viết rời từng âm tiết nên máy phải tự đoán chỗ nào là một từ, và ranh giới từ hay bị cắt hoặc ghép sai — "hoà bình" tách thành "hoà" và "bình" ở hai vế khác nhau. Đọc thì vẫn hiểu, nhưng nếu bạn định tìm kiếm theo cụm từ trong kho bản gỡ băng thì đây là chỗ làm bạn hụt kết quả.

Chuyện thứ hai mang tính kỹ thuật: các chữ ă, â, đ, ê, ô, ơ, ư có thể được mã hoá theo hai cách khác nhau trong Unicode — chữ "ế" dựng sẵn, hoặc "ê" cộng dấu sắc rời. Nhìn giống hệt, nhưng khi dán sang phần mềm khác hoặc tìm kiếm thì có thể không khớp. Gặp hiện tượng "rõ ràng có chữ đó mà tìm không ra" thì đây thường là nguyên nhân.

Giọng Bắc, Trung, Nam

Đây là chỗ nhiều bài quảng cáo né tránh, nên nói thẳng: kết quả không đều nhau giữa các vùng.

GiọngThường gặp
Giọng chuẩn miền Bắc (Hà Nội), giọng phát thanhỔn nhất — mô hình học nhiều nhất từ nguồn dạng này
Giọng Sài Gòn và Nam Bộ nói chungCũng khá ổn; hay sai ở các âm cuối và cặp phụ âm đầu v/d, n/ng
Giọng Huế và Quảng Nam, Quảng NgãiTỉ lệ lỗi cao hơn thấy rõ, nhất là ở thanh điệu và nguyên âm
Giọng Nghệ An, Hà TĩnhKhó nhất trong các vùng phổ biến — khác biệt cả thanh điệu lẫn từ vựng địa phương
Từ địa phương (mô, tê, răng, rứa, chi)Hay bị viết thành từ toàn dân gần âm

Nếu bạn phỏng vấn ở miền Trung hoặc gỡ băng cuộc gọi bán hàng với khách khắp cả nước, hãy tính trước một vòng soát dày hơn. Còn nếu bản ghi chủ yếu là họp nội bộ ở Hà Nội hay TP.HCM thì dấu thanh mới là chỗ tốn thời gian nhất, không phải giọng vùng.

Chèn tiếng Anh giữa câu — chuyện của dân văn phòng Việt Nam

Không ai nói "hạn chót" nữa, người ta nói "deadline". Chúng ta "book lịch", "check lại", "ship hàng", "gửi brief", "xin feedback", "set up cái meeting". Một cuộc họp marketing hay công nghệ ở Việt Nam là văn bản trộn hai ngôn ngữ, và đây là điểm mà các công cụ chỉ tối ưu cho một ngôn ngữ hay vấp.

Cơ chế cần biết: việc nhận diện ngôn ngữ được quyết định theo từng bản ghi, không đổi qua đổi lại giữa chừng. Nghĩa là:

Tên riêng, số hiệu văn bản và con số

Nhóm lỗi bạn gần như chắc chắn phải sửa tay, ở mọi phần mềm chứ không riêng gì cái nào:

Mẹo: dùng tìm và thay thế cho những tên lặp lại nhiều lần, sửa một lần cho cả bản.

Micro và tiếng ồn quan trọng với tiếng Việt hơn bạn nghĩ

Thông tin thanh điệu nằm ở cao độ giọng nói, mà cao độ là thứ dễ mất nhất khi âm thanh bị nén mạnh, bị vọng hoặc lẫn ồn. Cùng một mức nhiễu, tiếng Việt chịu thiệt hơn các ngôn ngữ không có thanh điệu — mất dấu là mất nghĩa.

Cụ thể: bản ghi cuộc gọi phát qua loa ngoài rồi thu lại bằng micro là nguồn tệ nhất; phỏng vấn trong quán cà phê tệ nhì; máy ghi âm để giữa bàn họp đông người làm người ngồi xa gần như mất tiếng. Ngược lại, một chiếc tai nghe có micro loại thường cũng đã cải thiện rõ rệt.

Cách tự kiểm chứng trong mười lăm phút

Đừng tin bài trên trang bán hàng, kể cả bài này. Cách duy nhất trả lời được câu "nó nghe tiếng Việt của tôi có ra không" là thử bằng chính bản ghi của bạn. Gợi ý bộ mẫu:

Ba file đó nằm gọn trong hạn mức miễn phí. Tải ứng dụng từ Mac App Store miễn phí: bản miễn phí cho gỡ băng tổng cộng 5 file audio và 5 file video — trọn đời, không phải mỗi ngày — cùng 5 phút nhập liệu bằng giọng nói mỗi ngày. Ghi âm thì không giới hạn, và gỡ băng lại một bản đã gỡ rồi thì không tốn thêm lượt, nên bạn thử lại với cài đặt ngôn ngữ khác nhau thoải mái. Thấy dùng được thì mở khoá Pro trong ứng dụng: 49,99 $ trả một lần, không phải thuê bao (khoảng 1,2–1,3 triệu ₫ — đây là ước tính, số tiền thật hiển thị trên App Store Việt Nam). Cấu hình: macOS 13 (Ventura) trở lên, Apple Silicon (M1 trở lên) bắt buộc, máy Mac chip Intel không chạy được.

Nếu bản ghi thử của bạn có giọng người khác, hãy xin phép họ trước — nói ngay đầu buổi "mình xin phép ghi âm để làm biên bản" là cách quen thuộc và an toàn nhất. Điều 38 Bộ luật Dân sự 2015 quy định việc thu thập, lưu giữ, sử dụng thông tin về đời sống riêng tư, bí mật cá nhân của người khác phải được người đó đồng ý. Đây là thông tin tham khảo, không phải tư vấn pháp lý.

Tải trên Mac App Store

Tải miễn phí — bản miễn phí có giới hạn. Không thuê bao. · Mở khoá Pro 49,99 $, trả một lần · macOS 13 trở lên

Câu hỏi thường gặp

Gỡ băng tiếng Việt có chính xác không?

Với bản ghi sạch — một người nói, micro gần, phòng yên tĩnh — kết quả đủ tốt để bạn biên tập thay vì gõ lại từ đầu. Nhưng đây là bản nháp: dấu thanh, tên riêng và thuật ngữ chuyên ngành là những chỗ cần soát tay. Chúng tôi không công bố con số phần trăm độ chính xác vì chưa có phép đo đủ chuẩn để công bố.

Vì sao bản gỡ băng hay sai dấu thanh?

Vì thanh điệu nằm ở cao độ giọng nói, mà cao độ là thứ dễ mất nhất khi âm thanh bị nén mạnh, bị vọng hoặc lẫn tiếng ồn. Hai lỗi phổ biến nhất là mất dấu ở cuối câu khi người nói xuống giọng, và lẫn giữa thanh hỏi với thanh ngã. Khi soát, hãy để ý những chữ đúng chính tả nhưng sai ngữ cảnh.

Giọng miền Trung có nhận dạng được không?

Được, nhưng tỉ lệ lỗi cao hơn thấy rõ so với giọng chuẩn miền Bắc và giọng Sài Gòn, vì giọng Huế, Quảng Nam, Nghệ An và Hà Tĩnh khác biệt cả về thanh điệu lẫn từ vựng. Từ địa phương như mô, tê, răng, rứa hay bị viết thành từ toàn dân gần âm. Nếu công việc của bạn chủ yếu là giọng miền Trung, hãy tính trước một vòng soát dày hơn.

Tôi hay nói chen tiếng Anh giữa câu thì có sao không?

Vài từ tiếng Anh lẻ tẻ như deadline, feedback, meeting thường không gây vấn đề. Cả một đoạn dài toàn tiếng Anh mới làm kết quả rối, vì việc nhận diện ngôn ngữ được quyết định theo từng bản ghi chứ không đổi giữa chừng. Cách xử lý là thu hẹp danh sách ngôn ngữ ưu tiên còn Tiếng Việt và Tiếng Anh trong cài đặt mô hình.

Có cần kết nối Internet để gỡ băng tiếng Việt không?

Không, trừ lần tải mô hình nhận dạng đầu tiên. Sau đó việc nhận dạng chạy bằng GPU của chính máy Mac, nên file không rời khỏi máy và ứng dụng chạy được cả khi bạn ở chế độ máy bay hoặc dùng mạng nội bộ chặn dịch vụ nước ngoài.

Làm sao thử trước khi mua?

Tải ứng dụng miễn phí rồi chạy thử ba bản ghi của chính bạn: một bản sạch, một bản họp thật, một bản khó. Bản miễn phí cho gỡ băng tổng cộng 5 file audio và 5 file video, tính trọn đời chứ không phải mỗi ngày, cùng 5 phút nhập liệu bằng giọng nói mỗi ngày; ghi âm không giới hạn và gỡ băng lại một bản đã gỡ thì không tốn thêm lượt. Thấy dùng được thì mở khoá Pro với 49,99 $ trả một lần, không phải thuê bao.

Bài liên quan