الرئيسية › تمييز المتحدثين
المقابلات والاجتماعات · نسبة الكلام لقائله
تمييز المتحدثين: من قال ماذا داخل التسجيل
نص التفريغ بلا أسماء كتلة واحدة يصعب استعمالها. تمييز المتحدثين يفصل الأصوات داخل التسجيل تلقائيًا وينسب كل جملة إلى قائلها، فتتحول المقابلة أو الاجتماع إلى نص مرتّب يمكن اقتباسه وتوزيعه — والمعالجة كلها داخل الماك، فلا يُرفع الصوت إلى أي خادم.
المصطلح: ثلاث صيغ لمعنى واحد
المقابل الإنجليزي هو speaker diarization، ولم يستقر له مقابل عربي واحد؛ ستقرأ «تمييز المتحدثين» و«فصل المتحدثين» و«تحديد المتحدث تلقائيًا»، وكلها تشير إلى العملية نفسها: تقسيم التسجيل زمنيًا ونسبة كل مقطع إلى صوت مختلف. وهي غير «التعرّف على الكلام» الذي يجيب عن سؤال ماذا قيل؛ تمييز المتحدثين يجيب عن سؤال من قال ذلك، والاثنان معًا هما ما يصنع محضرًا مقروءًا.
كيف يعمل تمييز المتحدثين تقنيًا
العملية أربع مراحل تجري كلها داخل جهازك:
- كشف الكلام. يُميَّز أولًا ما هو كلام بشري مما هو صمت أو ضجيج، فتُحذف الفراغات التي لا فائدة منها.
- استخراج بصمة صوتية. يُحوَّل كل مقطع كلام إلى تمثيل رقمي يصف خصائص الصوت — طبقته، ورنينه، وطريقة نطق صاحبه — لا كلماته.
- التجميع. تُجمَّع المقاطع المتشابهة صوتيًا في مجموعات، كل مجموعة تمثّل متحدثًا واحدًا. إن كنت تعرف عدد المتحدثين مسبقًا، فتحديده يحسّن النتيجة تحسينًا ملموسًا.
- النسبة والدمج. يُنسب كل مقطع إلى مجموعته، وتُدمج المقاطع المتتالية لنفس المتحدث في فقرة واحدة قابلة للقراءة.
ثم تأتي خطوتك أنت: تستمع إلى مقطع قصير من كل مجموعة وتعطيها اسم صاحبها، فيتحول «متحدث 1» و«متحدث 2» إلى أسماء حقيقية في النص كله دفعة واحدة.
الميزة الأثقل عمليًا: بصمة صوت محفوظة
أغلب الأدوات تنسى المتحدثين بمجرد إغلاق الملف، فتبدأ التسمية من الصفر في كل تسجيل. هنا تُحفَظ بصمة الصوت داخل جهازك، فيُتعرَّف على الشخص نفسه في التسجيلات اللاحقة.
مثال ملموس: تجري يوم الأحد مقابلة مع ثلاثة أشخاص وتسمّيهم بأسمائهم. وبعد أسبوعين تسجّل جلسة متابعة مع اثنين منهم وشخص جديد. عند تفريغ التسجيل الثاني يظهر الاثنان بأسمائهما مباشرة، ويبقى عليك تسمية الصوت الجديد وحده. في مشروع بحثي من عشرين مقابلة، أو في سلسلة اجتماعات أسبوعية بالفريق نفسه، يوفّر هذا ساعات من العمل المتكرر — ويجعل الأرشيف قابلًا للبحث باسم الشخص لا برقم المتحدث.
من يحتاجه فعلًا
- الصحفي. الاقتباس يجب أن يُنسب إلى قائله بلا لبس، ومراجعة تسجيل ساعتين للتأكد من قائل جملة واحدة عمل مرهق ومتكرر.
- الباحث الميداني ومحلل مقابلات المستخدمين. تحليل عشرين مقابلة يبدأ بفرز من قال ماذا، وتسمية المتحدثين تلقائيًا تختصر مرحلة كاملة من التفريغ اليدوي.
- مسؤول محضر الاجتماع. المحضر الصالح للتوزيع يحتاج إلى نسبة القرارات والالتزامات إلى أصحابها، لا إلى نص متصل بلا أسماء. تفصيل ذلك في صفحة محضر اجتماع تلقائي.
- من يفرّغ الجلسات الاستشارية أو التدريبية ويحتاج إلى الفصل بين سؤال العميل وإجابة المستشار.
حدود الدقة — بصراحة
تمييز المتحدثين تقدير احتمالي لا حقيقة قاطعة، وهذه المواضع التي تنخفض فيها جودته في كل الأنظمة:
- التداخل الشديد في الكلام. حين يتحدث شخصان في وقت واحد، قد يُنسب المقطع إلى أحدهما فقط أو يُقسَّم على نحو غير دقيق.
- ميكروفون بعيد أو قاعة ذات صدى. الصدى يخلط خصائص الأصوات، وهو أكثر سبب منفرد لنتيجة رديئة.
- أصوات متقاربة الطبقة، كأخوين أو زميلين متشابهي النبرة، قد تُدمج في مجموعة واحدة.
- متحدث لا يقول سوى جملة واحدة قصيرة. المادة الصوتية أقل من أن تُبنى عليها بصمة موثوقة.
- تغيّر الحالة الصوتية: زكام، أو همس، أو مكالمة هاتفية مضغوطة، قد تُبعد الصوت عن بصمته المحفوظة.
لذلك النتيجة تُراجَع يدويًا، خصوصًا عند حدود المقاطع وفي المواضع التي ستقتبسها. والتصحيح سريع: تغيير نسبة مقطع إلى متحدث آخر يستغرق ثوانٍ، والفائدة أنك تصحّح استثناءات بدل أن تكتب النص من الصفر.
كيف ترفع جودة التمييز
- قرّب الميكروفون من المتحدثين قدر الإمكان، وتجنّب وضعه في منتصف طاولة كبيرة.
- حدّد عدد المتحدثين المتوقع إن كنت تعرفه؛ هذا يمنع تشتيت الكلام على مجموعات أكثر من اللازم.
- اطلب في بداية الاجتماع أن يعرّف كل شخص بنفسه بجملة. هذا يمنحك مقطعًا نظيفًا لكل صوت يسهّل التسمية، وهو عرف مهني مقبول في اجتماعات العمل.
- قلّل المقاطعات. اتفاق بسيط على عدم الحديث المتزامن يحسّن التمييز والتفريغ معًا.
- سمِّ الأصوات مرة واحدة بدقة، فالبصمة المحفوظة ستفيدك في كل التسجيلات التالية.
أدوات التصحيح المتاحة لك
لأن النتيجة تقدير، فالمهم أن يكون تصحيحها سريعًا. ما تستطيع فعله بعد التفريغ:
- تسمية المجموعة. تعطي مجموعة الصوت اسمًا واحدًا فينعكس على كل مقاطعها في النص كله.
- إعادة نسبة مقطع بعينه إلى متحدث آخر حين يخطئ التجميع في جملة أو جملتين.
- دمج مجموعتين اتضح أنهما للشخص نفسه — وهو ما يحدث حين يتغيّر صوت المتحدث بين بداية الجلسة ونهايتها.
- فك ارتباط صوت ببصمة محفوظة إن نُسب خطأً إلى شخص من تسجيل سابق.
- إعادة تسمية شخص لاحقًا فيسري الاسم الجديد على ما يخصّه في التسجيل.
ما الذي تحصل عليه في النهاية
بعد التسمية يصبح لديك نص مقسَّم إلى مقاطع، لكل مقطع وقته واسم قائله، وقابل للتصدير بصيغة TXT لتحريره أو إرساله، أو بصيغة SRT وVTT إن كان المصدر مقطع فيديو تحتاج له ملف ترجمة. كما يمكن تصدير سجل التفريغات كاملًا بصيغ TXT وJSON وCSV للأرشفة أو للتحليل في جدول بيانات.
هذه هي النقلة العملية: من ملف صوتي لا يمكن الاستشهاد به إلى وثيقة نصية منسوبة، يمكن البحث فيها باسم الشخص، وقصّ الاقتباس منها بثقة أنك تنسبه إلى قائله.
الموافقة والاستخدام المسؤول
تمييز المتحدثين يعني بطبيعته أنك تعالج أصوات أشخاص آخرين. القاعدة العملية: أخبِر المشاركين قبل بدء التسجيل واحصل على موافقتهم صراحةً، والتزم بسياسة جهة عملك. تسجيل محادثة خاصة دون علم أطرافها قد يشكّل مخالفة أو جريمة في عدد من الدول العربية، وقواعد تسجيل المكالمات الهاتفية أشد من قواعد التسجيل داخل الغرفة؛ وهذه إشارة عملية لا استشارة قانونية. جملة واحدة في البداية تكفي عادةً: «سأسجّل الجلسة لكتابة المحضر».
وللوضوح: كون المعالجة داخل جهازك وصف لبنية البرنامج لا حكم قانوني على استعمالك. نحن لا ندّعي توافقًا ولا اعتمادًا مع أي نظام لحماية البيانات الشخصية؛ تقدير ذلك يعود إلى الإدارة القانونية أو مسؤول أمن المعلومات لديك. كذلك لا يوجد ضمان بصلاحية النص كسجل قانوني؛ فهو مخرج آلي يحتاج مراجعة واعتمادًا بشريًا.
لماذا يهم أن يجري كل هذا داخل الجهاز
البصمات الصوتية بيانات حساسة بطبيعتها: هي ما يجعل التعرّف على الشخص ممكنًا في تسجيل لاحق. في الخدمات السحابية يُرفع التسجيل وتُبنى هذه البصمات على خادم المزوّد. هنا يبقى الملف والبصمة والنص داخل الماك، فلا يوجد سؤال عن مدة الاحتفاظ ولا عن موقع الخادم ولا عن من يملك حق الاطلاع، ولا حاجة إلى حساب أو اتصال بالإنترنت أصلًا. شرح البنية بالتفصيل في صفحة المعالجة على الجهاز.
المتطلبات والسعر
يعمل تمييز المتحدثين ضمن مسار تفريغ كامل يتعرّف على 99 لغة ويحدّد اللغة تلقائيًا. متطلبات التشغيل: macOS 13 فأحدث وشريحة Apple Silicon من M1 فأحدث — إلزامية لا مستحسنة.
التحميل مجاني، وتشمل النسخة المجانية 5 عمليات تفريغ لملفات صوتية و5 لملفات فيديو مدى الحياة وإملاء 5 دقائق يوميًا، بينما التسجيل غير محدود وإعادة تفريغ ملف سبق تفريغه مجانية. ولإزالة الحدود تُفتح النسخة الكاملة بشراء داخل التطبيق مرة واحدة بـ $49.99 ودون اشتراك. وإن أردت رؤية مكان هذه الخطوة ضمن العملية كاملة، تابع كيفية تفريغ تسجيل صوتي خطوة بخطوة.
التحميل مجاني. دفعة واحدة لفتح Pro. بلا اشتراك. · $49.99 مرة واحدة، ويظهر السعر بعملة متجرك · macOS 13 فأحدث
الأسئلة الشائعة
ما معنى تمييز المتحدثين؟
هو تقسيم التسجيل زمنيًا ونسبة كل مقطع إلى الصوت الذي نطقه، فيظهر في النص من قال كل جملة. المقابل الإنجليزي speaker diarization، ويُسمّى أيضًا فصل المتحدثين أو تحديد المتحدث تلقائيًا. وهو غير التعرّف على الكلام الذي يحدد ماذا قيل لا من قاله.
هل يتعرّف التطبيق على المتحدث نفسه في تسجيلات لاحقة؟
نعم. تُحفظ بصمة صوت كل شخص سمّيته داخل جهازك، فيظهر باسمه مباشرة في التسجيلات التالية دون إعادة تسمية. هذا مفيد في سلسلة اجتماعات بالفريق نفسه أو في مشروع بحثي متعدد المقابلات.
ما الذي يخفض دقة فصل الأصوات؟
تداخل الكلام حين يتحدث شخصان معًا، والميكروفون البعيد أو القاعة ذات الصدى، والأصوات المتقاربة في الطبقة، والمتحدث الذي لا يقول سوى جملة قصيرة. النتيجة تقدير احتمالي يُراجع يدويًا، خصوصًا عند حدود المقاطع وفي المواضع التي ستقتبسها.
هل أستطيع تصحيح نسبة مقطع إلى متحدث آخر؟
نعم، وتغيير النسبة يستغرق ثوانٍ. الفكرة أن تصحّح استثناءات قليلة بدل كتابة النص من الصفر، ثم تصدّر المحضر بعد المراجعة.
هل يجري تمييز المتحدثين على خادم؟
لا. كشف الكلام واستخراج البصمات والتجميع والتفريغ كلها تجري داخل الماك على معالج الرسوميات، ولا يُرفع الصوت ولا النص ولا البصمات إلى أي خادم، ولا يحتاج التطبيق إلى حساب ولا إلى اتصال بالإنترنت بعد تنزيل النموذج مرة واحدة.
هل يجوز لي تسجيل الآخرين لتفريغ كلامهم؟
أخبِر المشاركين قبل بدء التسجيل واحصل على موافقتهم، والتزم بسياسة جهة عملك. تسجيل محادثة خاصة دون علم أطرافها قد يشكّل مخالفة أو جريمة في عدد من الدول العربية، وقواعد تسجيل المكالمات الهاتفية أشد. والنص المفرَّغ مخرج آلي يُراجَع بشريًا، ولا يوجد ضمان بصلاحيته كسجل قانوني.