Beranda › Pengenalan suara offline

Dasar-dasar · Pengenalan suara di Mac

Pengenalan suara offline: apa artinya secara teknis

Pengenalan suara offline berarti model bahasanya berjalan di komputer Anda sendiri: ucapan diubah menjadi teks di sana, dan berkas audionya tidak pernah dikirim ke server mana pun. Istilah lain untuk hal yang sama adalah "pemrosesan on-device", "diproses lokal di perangkat", dan dalam bahasa Inggris speech to text offline.

100%diproses di Mac — audio tidak pernah diunggah
Gratisdiunduh — Pro sekali bayar $49,99
99bahasa, terdeteksi otomatis
macOS 13+Apple Silicon (M1 atau lebih baru)

Definisi singkat

Pengenalan suara adalah proses mengubah ucapan menjadi teks secara otomatis. Secara istilah, yang lebih tepat sebenarnya adalah pengenalan ucapan — yang dikenali adalah kata-kata yang diucapkan, bukan identitas orang yang mengucapkannya — tetapi "pengenalan suara" jauh lebih hidup dan jauh lebih sering dicari, jadi itu yang dipakai di halaman ini.

Yang membedakan bukan apakah teknologinya bekerja, melainkan di mana ia bekerja. Pada layanan cloud, aplikasi merekam suara Anda, mengunggah berkas audionya ke server penyedia, model dijalankan di sana, lalu teks jadinya dikirim balik ke layar Anda. Pada pemrosesan offline, model sejenis tersimpan sebagai berkas di disk Mac Anda, dan seluruh perhitungan dikerjakan oleh prosesor dan GPU di dalam Mac itu. Jalur datanya pendek: suara masuk, teks keluar, tidak ada jaringan di antaranya.

Ini bukan detail pemasaran, melainkan keputusan arsitektur dengan akibat yang sangat konkret: pada kerahasiaan rekaman, pada kemampuan bekerja saat sinyal hilang, pada biaya, dan pada tuntutan terhadap perangkat keras Anda.

Beda cloud dan lokal dalam praktik

Keduanya hari ini sama-sama menghasilkan teks yang layak pakai. Perbedaannya ada pada apa yang terjadi selain teks itu.

Offline (diproses lokal)Cloud
Tempat pemrosesanMac AndaServer penyedia
Berkas audio keluar dari perangkatTidakYa
Bisa dipakai tanpa internetBisaTidak
Perlu membuat akunTidakUmumnya ya
Model biayaUmumnya sekali bayarUmumnya per menit atau langganan
Tuntutan perangkat kerasTinggi — perlu chip modernRendah
Lama proses rekaman panjangTergantung Mac AndaTergantung antrean server

Dua baris terakhir adalah sisi jujurnya: pemrosesan offline memindahkan beban komputasi ke pundak Anda. Wawancara dua jam akan membuat kipas Mac terdengar selama transkripnya dibuat. Imbalannya, tidak ada satu pun salinan rekaman itu yang berada di tempat yang tidak Anda kendalikan.

Kenapa banyak orang mengetik "speech to text offline"

Di Indonesia istilah teknis sering dicari langsung dalam bahasa Inggris, dan speech to text offline adalah salah satu yang paling sering diketik. Maksudnya sama persis dengan "pengenalan suara offline" atau "diproses lokal di perangkat": modelnya ada di dalam disk, bukan di server. Istilah "on-device" yang banyak muncul di materi berbahasa Inggris juga berarti hal yang sama.

Dua hal lain sering tertukar dengan ini. Identifikasi pembicara — secara teknis disebut diarisasi — menjawab siapa yang bicara, bukan apa yang dikatakan; keduanya baru berguna kalau digabung. Sementara Voice Control bawaan macOS menjalankan perintah seperti "buka Safari", bukan menuliskan kalimat panjang.

Kenapa Apple Silicon wajib, dan cara memeriksanya sebelum membayar

Model pengenalan ucapan modern berisi ratusan juta sampai beberapa miliar parameter. Supaya transkripnya selesai lebih cepat daripada durasi rekamannya, perhitungan itu harus dijalankan di GPU, dan modelnya harus muat di memori yang bisa diakses bersama oleh prosesor dan GPU.

Arsitektur memori terpadu pada Apple Silicon menyediakan tepat hal itu: prosesor dan GPU memakai memori yang sama, sehingga model tidak perlu disalin bolak-balik. Mac dengan prosesor Intel tidak punya prasyarat tersebut. Karena itu Mac dengan Apple Silicon (M1 atau yang lebih baru) adalah syarat wajib, bukan saran — aplikasinya tidak berjalan di Mac Intel sama sekali. Sistem operasi minimumnya macOS 13 (Ventura).

Di Indonesia MacBook bekas dengan prosesor Intel masih banyak diperjualbelikan, jadi periksa sendiri sebelum mengeluarkan uang: klik logo Apple di pojok kiri atas layar, lalu pilih Tentang Mac Ini. Kalau di sana muncul baris Chip dengan nama seperti Apple M1, M2, M3, atau M4, Mac Anda cocok. Kalau yang muncul baris Prosesor dengan nama Intel, Mac itu tidak cocok, dan tidak ada pengaturan yang bisa mengubahnya.

Seberapa akurat pengenalan suara offline?

Untuk dikte dan untuk rekaman percakapan yang diambil dengan wajar, model yang berjalan lokal hari ini berada di kelas yang sama dengan layanan cloud. Sumber kesalahannya pun sama, dan hampir selalu ada pada suaranya, bukan pada modelnya:

Kesimpulan realistisnya: hasil mesin adalah transkrip mentah. Ia menghapus sebagian besar pekerjaan mengetik, tetapi tidak menghapus pekerjaan membaca ulang — terutama di bagian yang nanti Anda kutip.

Arti "tidak meninggalkan Mac", dan apa yang bukan artinya

Pemrosesan lokal adalah pernyataan tentang arsitektur: tidak ada unggahan berkas audio, tidak ada layanan yang menerima rekaman Anda, tidak ada akun yang harus dibuat, dan tidak ada telemetri isi transkrip. Aplikasinya berjalan penuh dalam mode pesawat.

Yang tidak otomatis mengikuti dari situ adalah keabsahan pemrosesan yang Anda lakukan sendiri. Apakah Anda boleh merekam, menyimpan, dan mengolah sebuah percakapan bergantung pada tujuannya, pada orang-orang di dalamnya, dan pada aturan organisasi Anda. Kami tidak menyatakan kepatuhan terhadap Undang-Undang Pelindungan Data Pribadi maupun sertifikasi apa pun; penilaian itu harus Anda pastikan dengan penasihat hukum atau tim kepatuhan Anda. Arsitektur ini hanya menghapus satu pertanyaan yang biasanya paling awal muncul: ke mana rekamannya pergi.

Ada juga bagian yang tetap menjadi tanggung jawab Anda. Model bahasanya diunduh sekali dari internet saat pemasangan. Setelah itu, hasil transkrip tersimpan sebagai berkas biasa di disk Anda — jadi enkripsi disk (FileVault), kunci layar, dan cara Anda mencadangkan berkas adalah urusan Anda, bukan urusan aplikasi.

Kalau ada suara orang lain di dalam rekaman

Begitu ada orang lain yang ikut terekam, pertanyaan teknisnya justru yang paling kecil. Merekam percakapan yang Anda ikuti sendiri pada umumnya bukan penyadapan: UU ITE mendefinisikan intersepsi sebagai perekaman oleh pihak yang bukan peserta komunikasi. Tetapi itu bukan izin bebas. Sejak UU PDP berlaku penuh, suara peserta lain adalah data pribadi, dan menyebarkan rekaman atau transkrip kepada pihak ketiga tanpa persetujuan dapat berujung pada sanksi, termasuk sanksi pidana.

Norma yang benar-benar dipakai di kantor Indonesia bukan formulir, melainkan pengumuman lisan di awal — "mohon izin rapat ini saya rekam untuk keperluan notulen" — lalu persetujuan itu dicatat di notulen. Perlu diketahui juga bahwa Putusan Mahkamah Konstitusi No. 20/PUU-XIV/2016 membuat kedudukan rekaman pribadi menjadi sangat terbatas, sehingga tidak ada jaminan sebuah rekaman atau transkrip berlaku sebagai alat bukti. Ini informasi umum, bukan nasihat hukum.

Pengenalan suara offline di Mac

Lesskeys adalah aplikasi macOS yang seluruh pemrosesannya lokal: ketik dengan suara lewat pintasan papan ketik, plus transkrip rekaman rapat, wawancara, berkas audio, dan berkas video, lengkap dengan pemisahan pembicara otomatis. 99 bahasa dikenali dan bahasanya terdeteksi otomatis. Teks hasil dikte disalin ke clipboard lalu Anda tempel sendiri dengan ⌘V — aplikasi tidak pernah mengetik sendiri ke aplikasi lain.

Aplikasinya gratis diunduh. Versi gratis mencakup dikte 5 menit per hari serta 5 transkrip audio dan 5 transkrip video (jumlah total seumur pemakaian, bukan per hari); merekam tidak pernah dibatasi, dan mentranskrip ulang berkas yang sudah pernah diproses tidak memotong kuota. Membuka Pro adalah pembelian dalam aplikasi sekali bayar $49,99, bukan langganan; App Store Indonesia menagihnya dalam rupiah sesuai kurs yang berlaku.

Kalau Anda ingin melihat urutan langkahnya, lanjutkan ke cara transkrip rekaman di Mac.

Unduh di Mac App Store

Gratis diunduh. Bayar sekali untuk membuka Pro. Tanpa langganan. · Pro $49,99 sekali bayar (ditagih dalam rupiah) · macOS 13 ke atas

Pertanyaan Umum

Apa itu pengenalan suara offline?

Pengenalan suara offline mengubah ucapan menjadi teks langsung di komputer Anda. Model bahasanya tersimpan sebagai berkas di disk dan perhitungannya dijalankan oleh prosesor serta GPU Mac, sehingga berkas audionya tidak diunggah ke server mana pun. Istilah lain untuk hal yang sama adalah pemrosesan on-device dan speech to text offline.

Apa bedanya pengenalan suara offline dengan layanan transkrip cloud?

Pada layanan cloud, rekaman Anda dikirim ke server penyedia untuk diproses, biasanya dengan akun dan tarif per menit. Pada pemrosesan offline, yang bekerja adalah Mac Anda sendiri: rekaman tidak keluar dari perangkat dan aplikasinya tetap jalan tanpa internet. Imbalannya, perangkat kerasnya harus cukup kuat.

Apakah hasilnya seakurat layanan cloud?

Untuk dikte dan rekaman percakapan yang diambil dengan wajar, hasilnya berada di kelas yang sama. Kesalahan terbesar pada kedua pendekatan datang dari kualitas rekaman, orang yang bicara bersamaan, istilah teknis dan singkatan instansi, serta campur kode Indonesia-Inggris. Hasil mesin tetap transkrip mentah yang perlu dibaca ulang.

Apakah aplikasi ini bisa jalan di MacBook Intel?

Tidak. Lesskeys mensyaratkan Mac dengan Apple Silicon, yaitu M1 atau yang lebih baru, dan minimal macOS 13 (Ventura). Periksa dulu lewat menu Apple lalu Tentang Mac Ini: kalau tertulis baris Chip dengan nama Apple M1 sampai M4, Mac Anda cocok; kalau tertulis Prosesor dengan nama Intel, tidak cocok.

Apakah pemrosesan lokal otomatis membuat saya aman secara hukum?

Tidak. Pemrosesan lokal adalah pernyataan tentang arsitektur: berkas audio tidak meninggalkan Mac Anda, tidak ada akun, dan tidak ada penyedia layanan yang menerimanya. Apakah perekaman dan pengolahan yang Anda lakukan sah harus dipastikan dengan penasihat hukum atau tim kepatuhan Anda. Kami tidak menyatakan kepatuhan atau sertifikasi apa pun.

Berapa biayanya dan apa saja isi versi gratisnya?

Aplikasinya gratis diunduh. Versi gratis memberi dikte 5 menit per hari serta 5 transkrip audio dan 5 transkrip video sebagai jumlah total seumur pemakaian; merekam tidak dibatasi dan mentranskrip ulang berkas yang sudah pernah diproses tidak memotong kuota. Pro dibuka lewat pembelian sekali bayar $49,99, bukan langganan.

Baca juga