หน้าแรก › แยกเสียงผู้พูด
แยกผู้พูดในบทถอด
แยกเสียงผู้พูด: รู้ว่าใครพูดประโยคไหนในไฟล์เดียว
บทถอดที่ไม่มีชื่อผู้พูดคือข้อความยาวเป็นพืดที่ต้องกลับไปฟังเสียงใหม่อยู่ดี การแยกเสียงผู้พูด คือการให้เครื่องตัดว่าช่วงไหนเป็นเสียงของใคร แล้วติดป้ายชื่อไว้รายประโยคพร้อมเวลา เหมาะกับงานสัมภาษณ์เชิงลึก สนทนากลุ่ม การสอบข้อเท็จจริง และการประชุมหลายคน ทั้งหมดประมวลผลในเครื่องของคุณ
แยกเสียงผู้พูดคืออะไร
การถอดเสียงตอบคำถามว่า “พูดว่าอะไร” ส่วนการแยกเสียงผู้พูดตอบคำถามว่า “ใครเป็นคนพูด” เมื่อรวมสองอย่างเข้าด้วยกัน บทถอดจะออกมาหน้าตาแบบนี้
- 0:00 ผู้สัมภาษณ์: ขออนุญาตเริ่มจากคำถามแรกนะคะ ทำงานตำแหน่งนี้มากี่ปีแล้ว
- 0:07 คุณวิภา: ประมาณหกปีค่ะ เริ่มจากทีมหน้าร้านก่อนแล้วย้ายมาทีมนี้
- 0:15 ผู้สัมภาษณ์: ตอนย้ายมา สิ่งที่ต่างจากที่คิดไว้คืออะไรบ้าง
ต่างจากข้อความก้อนเดียวยาวเป็นพืดที่ไม่รู้ว่าใครพูดตรงไหนอย่างเห็นได้ชัด สำหรับงานที่ต้องยกคำพูดมาอ้าง งานที่ต้องนับว่าใครพูดถึงประเด็นไหนบ้าง หรืองานที่ต้องเรียบเรียงเป็นรายงานการประชุม ป้ายชื่อผู้พูดคือสิ่งที่ทำให้ไฟล์นั้นใช้งานต่อได้จริง
เครื่องแยกได้อย่างไร
กระบวนการมีสามขั้นใหญ่ ๆ ทั้งหมดทำงานในเครื่องของคุณ
- ตัดช่วงที่มีคนพูด แยกส่วนที่เป็นเสียงพูดออกจากความเงียบและเสียงรบกวน
- สกัดลักษณะเฉพาะของเสียง จากแต่ละช่วง ออกมาเป็นชุดตัวเลขที่แทน “ลายเสียง” ของผู้พูด ไม่ใช่ความดังหรือระดับเสียงสูงต่ำ แต่เป็นคุณลักษณะของน้ำเสียงคนนั้น
- จัดกลุ่ม ช่วงที่มีลายเสียงใกล้เคียงกันเข้าเป็นคนเดียวกัน ถ้าคุณไม่ได้ระบุจำนวนคนไว้ ระบบจะประมาณจำนวนผู้พูดให้ในขั้นนี้
การคำนวณทั้งหมดเกิดบนจีพียูของชิป Apple Silicon ในเครื่อง ทั้งไฟล์เสียงและลายเสียงไม่ได้ถูกส่งขึ้นเซิร์ฟเวอร์ที่ไหน
ตั้งชื่อครั้งเดียว ใช้ต่อในไฟล์ถัดไป
ผลตั้งต้นจะเป็นป้ายกลาง ๆ อย่าง ผู้พูด 1 ผู้พูด 2 คุณเปลี่ยนเป็นชื่อจริงได้ และนี่คือจุดที่ประหยัดเวลาที่สุดของทั้งหน้านี้: ลายเสียงที่ตั้งชื่อไว้แล้วจะถูกจดจำและนำไปใช้กับไฟล์ถัดไป ที่มีคนคนเดิมอยู่ในนั้น
งานที่ได้ประโยชน์ชัดที่สุดคืองานที่มีคนหน้าเดิมซ้ำ ๆ
- ประชุมทีมประจำสัปดาห์ที่มีคนกลุ่มเดิมห้าหกคน ไม่ต้องไล่ตั้งชื่อใหม่ทุกครั้ง
- สัมภาษณ์เชิงลึกเป็นชุด ที่ผู้สัมภาษณ์คนเดิมคุยกับผู้ให้ข้อมูลหลายคน ผู้สัมภาษณ์จะขึ้นชื่อถูกตั้งแต่ไฟล์ที่สอง
- งานติดตามผลที่ต้องคุยกับผู้เข้าร่วมคนเดิมหลายรอบตลอดโครงการ
ลายเสียงถูกเก็บไว้ในเครื่อง และเปิดหรือปิดการจดจำได้จากการตั้งค่า
อะไรทำให้แยกได้ดี และอะไรทำให้พลาด
คุณภาพของการแยกผู้พูดขึ้นกับวิธีอัดมากกว่าที่คนส่วนใหญ่คิด
| สภาพการบันทึก | ผลที่ได้ |
|---|---|
| สัมภาษณ์ตัวต่อตัว ไมค์อยู่ใกล้ทั้งสองฝ่าย | แยกได้ดี |
| ประชุมออนไลน์ ต่างคนต่างใช้ไมค์หรือหูฟังของตัวเอง | แยกได้ดี |
| ผลัดกันพูดทีละคน ไม่พูดทับกัน | แยกได้ดี |
| ไมค์ตัวเดียววางกลางโต๊ะยาว | เสียงคนที่นั่งไกลเบา มักปนกัน |
| สนทนากลุ่มที่พูดทับกันบ่อย | ช่วงที่ทับกันมักตกหล่นหรือสลับคน |
| ผู้พูดที่น้ำเสียงใกล้เคียงกันมาก | อาจถูกรวมเป็นคนเดียวกัน |
| เสียงรับคำสั้น ๆ เช่น ครับ ค่ะ อืม | ข้อมูลน้อยเกินกว่าจะตัดสินได้แน่นอน |
| ห้องสะท้อนเสียง หรือมีเสียงแอร์ดัง | ความแม่นยำลดลงทั้งการถอดและการแยกผู้พูด |
พูดกันตามจริง ไม่มีเครื่องมือของค่ายไหนที่แยกได้ถูกทุกประโยค ให้วางแผนว่าจะมีขั้นตอนตรวจแก้เสมอ ในแอปคุณรวมผู้พูดที่ถูกแตกเกินให้เป็นคนเดียวกันได้ และย้ายประโยคที่ติดชื่อผิดไปให้คนที่ถูกต้องได้ การแก้นั้นจะถูกนำไปปรับปรุงลายเสียงที่เก็บไว้ด้วย
ใช้กับงานอะไรบ้าง
งานวิจัยเชิงคุณภาพ
การสัมภาษณ์เชิงลึกและการสนทนากลุ่มต้องแยกให้ได้ว่าใครพูดอะไร ก่อนจะนำไปให้รหัสหรือวิเคราะห์ประเด็น บทถอดที่มีป้ายชื่อและเวลาช่วยให้ย้อนกลับไปฟังตำแหน่งเดิมได้เร็ว และส่งออกเป็น TXT เพื่อนำเข้าเครื่องมือวิเคราะห์ต่อได้
ข่าวและการสัมภาษณ์
เมื่อจะยกคำพูดมาอ้าง คุณต้องมั่นใจว่าประโยคนั้นเป็นของใคร บทถอดแบบมีป้ายชื่อช่วยให้ตรวจสอบซ้ำได้เร็ว แต่ยังต้องกลับไปฟังเสียงจริงก่อนตีพิมพ์ทุกครั้ง
ฝ่ายบุคคลและงานสอบข้อเท็จจริง
บันทึกการพูดคุยที่มีหลายฝ่ายอยู่ในห้อง ป้ายชื่อผู้พูดทำให้บันทึกอ่านรู้เรื่อง แต่งานลักษณะนี้อ่อนไหวเป็นพิเศษ ให้อ่านหัวข้อถัดไปก่อนเริ่มใช้
งานวิจัยผู้ใช้และทีมผลิตภัณฑ์
บทสัมภาษณ์ผู้ใช้ที่แยกเสียงผู้ถามกับผู้ตอบออกจากกัน ทำให้สรุปประเด็นได้เร็วขึ้นมาก และไฟล์ยังอยู่ในเครื่องของทีม ไม่ต้องส่งไปที่ระบบภายนอก
ลายเสียงเก็บไว้ที่ไหน และต้องระวังอะไร
การจดจำผู้พูดข้ามไฟล์ทำได้เพราะแอปเก็บลายเสียงของคนนั้นไว้ ซึ่งเป็นการเก็บลักษณะเสียงของบุคคลอื่น จึงต้องพูดให้ชัดสองเรื่อง
เรื่องแรกคือที่เก็บ ลายเสียงทั้งหมดอยู่ในเครื่องของคุณ ไม่ได้ถูกส่งขึ้นเซิร์ฟเวอร์ใด และคุณปิดการจดจำหรือลบข้อมูลที่เก็บไว้ได้
เรื่องที่สองคือความยินยอม เสียงของบุคคลอื่นถือเป็นข้อมูลส่วนบุคคลตาม พ.ร.บ.คุ้มครองข้อมูลส่วนบุคคล พ.ศ. 2562 แม้จะประมวลผลในเครื่องก็ตาม ควรแจ้งผู้ถูกสัมภาษณ์ด้วยวาจาก่อนเริ่มบันทึก ว่าจะบันทึก เก็บไว้ที่ไหน ใช้ทำอะไร และจะเก็บไว้นานเท่าไร แล้วปล่อยให้คำแจ้งนั้นถูกบันทึกอยู่ในไฟล์ด้วย ตัวอย่างเช่น “ขออนุญาตบันทึกเสียงการสัมภาษณ์นะครับ ไฟล์จะเก็บไว้ในเครื่องของผมเพื่อใช้ถอดเป็นข้อความอย่างเดียว”
ในบริบทไทยมีจุดที่ต้องระวังเป็นพิเศษ ความเกรงใจทำให้คนที่อาวุโสน้อยกว่าหรือคนนอกองค์กรมักไม่ปฏิเสธต่อหน้าคนอื่น การเงียบไม่ใช่การยินยอม ให้ถามตรง ๆ และถ้าเขาไม่สะดวก ก็ต้องไม่บันทึกจริง ๆ สำหรับงานวิจัยที่ผ่านคณะกรรมการจริยธรรมการวิจัยในมนุษย์ ให้ทำตามเงื่อนไขในเอกสารที่ได้รับอนุมัติ ซึ่งหลายฉบับกำหนดไว้ตรง ๆ ว่าห้ามส่งไฟล์เสียงให้บุคคลที่สาม
ที่เสี่ยงกว่าการบันทึกคือการเผยแพร่ การนำคลิปหรือบทถอดไปโพสต์ต่อโดยไม่ได้รับอนุญาตมีความเสี่ยงทางกฎหมายสูงกว่าการเก็บไว้ใช้ภายในมาก เพราะการหมิ่นประมาทในไทยเป็นความผิดอาญาตามประมวลกฎหมายอาญา มาตรา 326 ถึง 328 และการเผยแพร่ทางออนไลน์ยังอาจเกี่ยวข้องกับ พ.ร.บ.ว่าด้วยการกระทำความผิดเกี่ยวกับคอมพิวเตอร์อีกชั้นหนึ่ง
สิ่งที่หน้านี้ยืนยันได้มีเพียงเรื่องสถาปัตยกรรม คือเสียงและผลลัพธ์อยู่ในเครื่อง ไม่มีการอัปโหลด ส่วนการใช้งานในองค์กรหรือในโครงการวิจัยของคุณ ให้ตรวจสอบกับ DPO ฝ่ายกฎหมาย หรือคณะกรรมการที่กำกับโครงการของคุณเอง หน้านี้ไม่ได้รับรองการปฏิบัติตามกฎหมายหรือมาตรฐานใด ๆ
ข้อจำกัดที่ต้องยอมรับ
การแยกผู้พูดเป็นการประมวลผลอัตโนมัติ จึงมีโอกาสสลับตัวผู้พูดได้ โดยเฉพาะเมื่อเสียงพูดทับกัน คุณภาพเสียงต่ำ หรือผู้พูดมีน้ำเสียงคล้ายกัน ผลที่ได้จึงเป็นร่างที่ต้องมีคนตรวจแก้ และไม่มีการรับประกันในฐานะบันทึกทางกฎหมาย สำหรับเรื่องสำคัญให้เก็บไฟล์เสียงต้นฉบับไว้คู่กับบทถอดเสมอ และตรวจกับเสียงจริงก่อนนำไปอ้างอิง
สำหรับภาษาไทยยังต้องเผื่อการตรวจแก้ตัวข้อความด้วย เพราะภาษาไทยไม่มีช่องว่างระหว่างคำ การตัดคำและวรรคตอนจึงเป็นการตีความของเครื่อง และคำทับศัพท์กับชื่อเฉพาะมักเพี้ยน
เครื่องที่ใช้ได้และค่าใช้จ่าย
ต้องใช้ macOS 13 ขึ้นไป และ Mac ชิป Apple Silicon (M1 ขึ้นไป) เท่านั้น เครื่อง Intel ใช้ไม่ได้ รองรับ 99 ภาษา ตรวจจับภาษาให้อัตโนมัติ
ดาวน์โหลดฟรี จาก Mac App Store แล้วปลดล็อก Pro ด้วยการซื้อครั้งเดียว $49.99 ไม่ใช่รายเดือน (App Store ไทยแสดงราคาเป็นเงินบาทตามที่ Apple กำหนด) เวอร์ชันฟรีให้ถอดไฟล์เสียง 5 ไฟล์และวิดีโอ 5 ไฟล์ นับรวมตลอดอายุการใช้งาน ไม่ใช่ต่อวัน พิมพ์ด้วยเสียงได้วันละ 5 นาที ส่วนการอัดเสียงเก็บไว้ไม่จำกัดจำนวน และการสั่งถอดซ้ำไฟล์ที่เคยถอดแล้วไม่กินโควตา พอสำหรับทดสอบกับไฟล์สัมภาษณ์จริงของคุณหนึ่งชุดก่อนตัดสินใจ
ดาวน์โหลดฟรี จ่ายครั้งเดียว ไม่ใช่รายเดือน · ปลดล็อก Pro $49.99 ครั้งเดียว (App Store ไทยแสดงราคาเป็นเงินบาท) · ต้องใช้ macOS 13 ขึ้นไป
คำถามที่พบบ่อย
แยกผู้พูดได้กี่คน
ระบบประมาณจำนวนผู้พูดให้เองโดยไม่ต้องระบุล่วงหน้า และถ้าคุณรู้จำนวนคนอยู่แล้วก็ระบุเพื่อให้ผลนิ่งขึ้นได้ ข้อจำกัดคือผู้พูดที่น้ำเสียงคล้ายกันมาก หรือคนที่พูดแค่คำรับสั้น ๆ อาจถูกจัดกลุ่มผิด
ต้องตั้งชื่อผู้พูดใหม่ทุกไฟล์ไหม
ไม่ต้อง ลายเสียงที่ตั้งชื่อไว้แล้วจะถูกจดจำและนำมาใช้กับไฟล์ถัดไปที่มีคนคนเดิมอยู่ ทำให้การประชุมประจำหรือการสัมภาษณ์เป็นชุดขึ้นชื่อถูกตั้งแต่ต้น
ลายเสียงถูกเก็บไว้ที่ไหน
เก็บไว้ในเครื่องของคุณเท่านั้น ไม่ได้ถูกส่งขึ้นเซิร์ฟเวอร์ใด และคุณเลือกปิดการจดจำหรือลบข้อมูลที่เก็บไว้ได้จากการตั้งค่า
ถ้าแยกออกมาไม่ถูกต้องทำอย่างไร
แก้ในแอปได้ ทั้งการรวมผู้พูดที่ถูกแตกเกินให้เป็นคนเดียวกัน และการย้ายประโยคที่ติดชื่อผิดไปให้ผู้พูดที่ถูกต้อง การแก้จะถูกนำไปปรับปรุงลายเสียงที่เก็บไว้ ทำให้ไฟล์ถัดไปแม่นขึ้น
ใช้กับการสัมภาษณ์งานวิจัยได้ไหม
ได้ และเป็นงานที่การแยกผู้พูดช่วยได้ชัดที่สุดงานหนึ่ง แต่ควรแจ้งผู้ให้สัมภาษณ์ด้วยวาจาก่อนบันทึกว่าจะบันทึก เก็บไว้ที่ไหน และใช้ทำอะไร เสียงของบุคคลอื่นเป็นข้อมูลส่วนบุคคลตาม พ.ร.บ.คุ้มครองข้อมูลส่วนบุคคล พ.ศ. 2562 แม้จะประมวลผลในเครื่อง หากโครงการผ่านคณะกรรมการจริยธรรมการวิจัยในมนุษย์ ให้ทำตามเงื่อนไขในเอกสารที่ได้รับอนุมัติ
บทถอดที่มีชื่อผู้พูดใช้เป็นหลักฐานได้ไหม
ไม่ควรใช้แทนบันทึกอย่างเป็นทางการ การแยกผู้พูดเป็นการประมวลผลอัตโนมัติที่อาจสลับตัวผู้พูดได้เมื่อเสียงทับกันหรือคุณภาพเสียงต่ำ จึงไม่มีการรับประกันในฐานะบันทึกทางกฎหมาย ให้เก็บไฟล์เสียงต้นฉบับไว้คู่กัน ตรวจกับเสียงจริงก่อนอ้างอิง และปรึกษาฝ่ายกฎหมายของคุณเอง
ใช้ฟรีได้แค่ไหน
ดาวน์โหลดฟรี ถอดไฟล์เสียงได้ 5 ไฟล์และวิดีโอ 5 ไฟล์ นับรวมตลอดอายุการใช้งาน ไม่ใช่ต่อวัน พิมพ์ด้วยเสียงได้วันละ 5 นาที การอัดเสียงเก็บไว้ไม่จำกัดจำนวน และการสั่งถอดซ้ำไฟล์เดิมไม่กินโควตา หากต้องการใช้เกินนี้จึงปลดล็อก Pro ด้วยการซื้อครั้งเดียว $49.99