Ana sayfa › Konuşmacı ayırma

Çok kişili kayıtlar · Konuşmacı ayrımı

Konuşmacı ayırma: kim ne dedi belli olsun

Üç kişinin konuştuğu bir kaydın düz metne dökülmesi çoğu zaman işe yaramaz — röportajda soruyu sorandan cevabı, toplantıda taahhüdü verenden itiraz edeni ayırmak gerekir. Lesskeys kaydı otomatik olarak seslere göre ayırır, konuşmacılara isim verirsiniz ve bu isimler sonraki kayıtlarda tanınır. Ses profilleri Mac'inizde kalır.

100%cihazınızda işlenir — ses hiçbir yere yüklenmez
Ücretsizindirilir — Pro kilidi tek seferlik 49,99 $
99dil, otomatik algılanır
macOS 13+Apple Silicon (M1 ve üzeri)

Konuşmacı ayırma nedir?

Konuşma tanıma ne söylendiğini yazar; konuşmacı ayırma kimin söylediğini ayırır. İkisi birleştiğinde ortaya “kim ne dedi” belli olan, okunabilir bir metin çıkar. Teknik literatürde bu işleme diyarizasyon denir; Türkçede oturmuş tek bir karşılığı olmadığı için “konuşmacı ayırma”, “konuşmacı ayrıştırma” ve gündelik dilde doğrudan “kim ne dedi” ifadeleriyle aranır.

Uygulama bunu yaparken isim ya da kimlik bilmez. Sesin akustik özelliklerinden yararlanarak kaydı, birbirinden ayrışan konuşmacı kümelerine böler. Sonuçta metin “Konuşmacı 1”, “Konuşmacı 2” gibi etiketlerle gelir; kim olduklarını siz söylersiniz.

Nasıl çalışıyor?

Sıra şöyledir. Önce kayıt, sesin olduğu ve olmadığı bölümlere ayrılır; sessizlik ve arka plan gürültüsü elenir. Sonra konuşma içeren her kısa parça için, o sesin tınısını özetleyen sayısal bir imza çıkarılır. Ardından bu imzalar birbirine benzerliklerine göre kümelenir: aynı kişiye ait parçalar bir araya gelir. Son adımda her kümenin konuşmaları metne çevrilir ve arka arkaya gelen aynı konuşmacıya ait bölümler birleştirilerek okunabilir bloklar oluşturulur.

Bu işlemlerin tamamı — ayırma da, metne çevirme de — Mac'inizin GPU'sunda yapılır. Kayıt bir sunucuya yüklenmez, hesap açmanız gerekmez.

İsim verin, bir daha uğraşmayın

“Konuşmacı 2” etiketine bir kez isim verdiğinizde uygulama o sesin imzasını kalıcı bir ses profili olarak saklar. Aynı kişi bir sonraki kayıtta konuştuğunda otomatik olarak tanınır ve metin doğrudan onun adıyla gelir. Haftalık ekip toplantısı, aynı danışanla yapılan seri görüşmeler ya da uzun soluklu bir araştırma projesi gibi durumlarda bu, her seferinde baştan etiketleme zahmetini ortadan kaldırır.

Profiller cihazda tutulur, bir sunucuya gönderilmez ve dilediğiniz zaman silinebilir. Bir profili sildiğinizde o ses artık tanınmaz; sonraki kayıtlarda yeniden isimsiz bir konuşmacı olarak görünür.

Konuşmacıya göre arama ve süzme

Metin konuşmacıya bağlandığı için kitaplıkta yeni bir arama biçimi açılır: yalnızca belirli bir kişinin söylediklerini süzebilir, kelimeye göre arayıp sonucun kime ait olduğunu görebilir, kayıt tarihiyle birleştirip “bu konuyu geçen ay kim açmıştı” türü sorulara bakabilirsiniz. Her satır kaydın içindeki konumunu taşıdığı için, bir cümleden orijinal sesteki o ana dönmek de mümkündür.

Kaydedilen kişilere söyleyin: rıza şart

Bu özellik doğrudan başkalarının sesiyle ilgili olduğu için, teknik ayrıntılardan önce halledilmesi gereken bir konu var. Türkiye'de TCK m.133, kişiler arasındaki aleni olmayan konuşmaların rıza dışında kayda alınmasını suç sayar. Kritik nokta şudur: bu hüküm, kaydı alan kişi konuşmanın taraflarından biri olsa bile uygulanır. Bazı ülkelerdeki “taraflardan birinin bilmesi yeter” yaklaşımı Türkiye için geçerli değildir. Ayrıca TCK m.134 kapsamında özel hayatın gizliliği ve kişisel verilerin hukuka aykırı biçimde kaydedilmesi ya da aktarılması (TCK m.135–136) da gündeme gelebilir.

Pratik akış: kaydı başlatmadan önce sözlü olarak sorun; “kayıt alıyorum” onayını kaydın ilk saniyelerinde ve çıkan metnin başında bırakın; itiraz eden olursa kaydetmeyin. Konuşmacı ayırma kullanacaksanız bir cümle daha eklemeniz gerekir: kişilere, seslerinin sonraki kayıtlarda tanınabilmesi için bir ses profili tutulacağını söyleyin ve buna da onay alın. İşyerinde çalışan kaydı söz konusuysa aydınlatma metni hazırlayın ve İK ile hukuk biriminin onayını alın. Bu bir bilgilendirmedir, hukuki tavsiye değildir.

Ses profili ve KVKK: sizin değerlendirmeniz gereken konu

Kalıcı ses profili, kişiyi sesinden tanımaya yarayan bir işlemedir. Bu nedenle KVKK (6698 sayılı Kanun) bakımından biyometrik veri olarak değerlendirilebilecek bir alandır ve m.6 uyarınca özel nitelikli kişisel veriler için kural olarak açık rıza aranır. Bunu bir uyarı olarak yazıyoruz, bir çözüm olarak değil.

Yazılım tarafında söyleyebileceğimiz şey yalnızca mimaridir: profiller Mac'inizde oluşturulur, orada kalır, bir sunucuya gönderilmez ve silinebilir. Bunun ötesindeki soruların cevabı bizde değil sizde: bu işlemede veri sorumlusu kim, aydınlatma yükümlülüğü nasıl yerine getirilecek, açık rıza gerekiyor mu ve nasıl alınacak, profiller ne kadar süre saklanacak, VERBİS kaydı gerekiyor mu. Bunlar kurumunuzun hukuk veya uyum biriminin değerlendireceği konulardır. Uygulama için hiçbir uygunluk, uyumluluk ya da sertifika iddiasında bulunmuyoruz; ayırma özelliğini rıza olmadan kullanmamanızı öneririz.

Nerede iyi çalışır, nerede şaşırır

Otomatik ayrım kusursuz değildir ve nerede zorlandığı öngörülebilir:

Kayıt koşuluAyrımın durumu
Kulaklık mikrofonuyla, sırayla konuşulan çevrimiçi görüşmeEn iyi sonucun alındığı durum
İki kişilik röportaj, mikrofon konuşanlara yakınİyi
Masanın ortasına konmuş tek mikrofonUzaktaki sesler zayıf kalır, kümeler karışır
Üst üste konuşmaEn sık hata kaynağı; hem metin hem atama bozulur
Birbirine yakın tınıdaki iki kişiTek konuşmacı olarak birleşebilir
“Evet”, “tamam” gibi bir saniyelik çıkışlarElde yeterli ses olmadığı için yanlış kişiye yazılabilir
Hoparlörden gelen uzak katılımcı, yankılı odaAyrımı belirgin biçimde zorlaştırır
Sekiz kişilik kalabalık toplantıKatılımcı sayısı arttıkça hata oranı da artar

Atamalar elle düzeltilebilir: yanlış kişiye yazılmış bir bölümü doğru konuşmacıya taşıyabilir, yanlışlıkla ikiye bölünmüş bir kişiyi birleştirebilir, isimleri sonradan değiştirebilirsiniz. En iyi sonucu almanın yolu ise teknik değil pratik: konuşanlara yakın bir mikrofon kullanın ve mümkünse sırayla konuşulan bir düzen kurun.

Kaç kişi olduğunu önceden söylemek

Uygulama konuşmacı sayısını kendiliğinden tahmin eder, ama görüşmeye kaç kişinin katıldığını biliyorsanız bu sayıyı ayarlardan verebilirsiniz. Sayının bilinmesi, özellikle sesleri birbirine yakın ve kalabalık kayıtlarda kümelemeyi toparlar: elde edilen parçalar belirtilen sayıda gruba bölünmeye çalışılır, böylece tek bir kişinin ikiye ayrılması ya da iki kişinin tek başlık altında toplanması olasılığı düşer.

Yanlış sayı vermenin de bir bedeli vardır: dört kişinin konuştuğu bir kayıtta “iki” derseniz iki konuşmacı zorunlu olarak birleştirilir. Emin değilseniz otomatik bırakın, sonucu görün ve gerekiyorsa sayıyı verip yeniden deşifre edin — daha önce deşifre edilmiş bir kaydı tekrar çevirmek ücretsiz sürümde de kotadan düşmez, dolayısıyla bu denemenin bir maliyeti yoktur.

Kimin işine yarar?

Gereksinimler ve fiyat

Uygulama macOS 13 (Ventura) ve üzeri sürümlerde çalışır; Apple Silicon (M1 veya üzeri) zorunludur — tavsiye değil, gerekliliktir ve Intel işlemcili Mac'lerde çalışmaz. Tanıma 99 dili kapsar, dil otomatik algılanır. Dikte tarafında metin panoya kopyalanır ve V ile siz yapıştırırsınız; uygulama başka programlara kendi kendine yazmaz.

İndirmesi ücretsizdir. Ücretsiz sürümde günde 5 dakika dikte ile toplam 5 ses ve 5 video deşifresi yapabilirsiniz — bu iki sayı günlük değil, ömür boyu toplamdır; kayıt almak sınırsızdır ve daha önce deşifre edilmiş bir kaydı yeniden çevirmek kotadan düşmez. Sınırları kaldıran Pro kilidi tek seferlik 49,99 $ tutarında bir uygulama içi satın almadır, abonelik yoktur; Türkiye App Store'unda TL karşılığı görünür.

Dosyadan metne akışın tamamı için: ses metne çevirme.

Mac App Store'dan indirin

İndirmesi ücretsiz — ücretsiz sürüm sınırlıdır. Abonelik yok. · Pro kilidi tek seferlik 49,99 $ (App Store TL karşılığını gösterir) · macOS 13 ve üzeri

Sık sorulan sorular

Konuşmacı ayırma nedir?

Bir kaydı, konuşan kişilere göre bölümlere ayırma işlemidir; teknik adı diyarizasyondur. Konuşma tanıma ne söylendiğini yazar, konuşmacı ayırma kimin söylediğini belirler. İkisi birlikte, kim ne dedi belli olan bir metin üretir.

Uygulama konuşmacıları nasıl ayırıyor?

Önce kayıttaki konuşma bölümleri ayrılır, sonra her kısa parça için sesin tınısını özetleyen sayısal bir imza çıkarılır ve bu imzalar benzerliklerine göre kümelenir. Kim olduklarını uygulama bilmez; etiketlere isimleri siz verirsiniz. Tüm işlem Mac'inizde yapılır.

Verdiğim isimler sonraki kayıtlarda hatırlanıyor mu?

Evet. Bir konuşmacıya isim verdiğinizde sesin imzası kalıcı bir ses profili olarak saklanır ve aynı kişi sonraki kayıtlarda otomatik tanınır. Profiller Mac'inizde kalır, bir sunucuya gönderilmez ve istediğiniz zaman silinebilir.

Ses profili tutmak KVKK açısından ne anlama geliyor?

Kalıcı ses profili, kişiyi sesinden tanımaya yarayan bir işleme olduğu için KVKK bakımından biyometrik veri olarak değerlendirilebilir ve m.6 uyarınca özel nitelikli veriler için kural olarak açık rıza aranır. Kaydedilen kişilere ses profili tutulacağını söyleyip onay alın; veri sorumlusu, aydınlatma, saklama süresi gibi konuları kurumunuzun hukuk veya uyum birimi değerlendirmelidir. Uygulama için hiçbir uygunluk iddiasında bulunmuyoruz.

Konuşmacı ayrımı ne zaman yanılıyor?

En çok üst üste konuşulan yerlerde, birbirine çok benzeyen ses tonlarında, bir saniyelik kısa araya girmelerde ve gürültülü hatlarda. İki-üç kişilik görüşmelerde sonuç kalabalık toplantılara göre belirgin biçimde daha iyidir. Yanlış atamalar elle düzeltilebilir.

Kaç kişiye kadar ayırabiliyor?

Teknik bir sayı vermek yanıltıcı olur, çünkü sınırı belirleyen kişi sayısı değil kayıt koşullarıdır. Katılımcı arttıkça ve mikrofon uzaklaştıkça hata oranı yükselir. Kalabalık bir toplantıda en iyi sonucu, konuşanlara yakın bir mikrofon ve sırayla konuşulan bir düzen verir.

İlgili sayfalar