Paxa Labs

บทความSpeech-to-Text

วัดความแม่นยำของการถอดเสียงภาษาไทย: ทำไม WER จึงหลอกตา

Word error rate ต้องการขอบเขตคำ และภาษาไทยเขียนโดยไม่มีขอบเขตนั้น วิธีให้คะแนนบทถอดภาษาไทยให้เทียบสองโมเดลได้ สิ่งที่ต้องทำให้เป็นมาตรฐานก่อน และวิธีสร้างชุดทดสอบจากเสียงของคุณเอง

· อ่าน 1 นาที

ผู้ให้บริการถอดเสียงทุกรายเผยแพร่ค่า word error rate และสำหรับภาษาไทย ตัวเลขนี้มีความหมายน้อยกว่าที่เห็น WER นับคำที่ถูกแทน ถูกลบ และถูกแทรก ระหว่างบทถอดอ้างอิงกับผลลัพธ์ของโมเดล หารด้วยจำนวนคำในบทอ้างอิง การนับต้องการขอบเขตคำ ภาษาอังกฤษใส่ช่องว่างที่ทุกขอบเขต ภาษาไทยใส่ช่องว่างท้ายวลีและไม่ใส่ที่อื่น และจุดที่คำหนึ่งจบภายในวลีเป็นการตัดสินใจของตัวตัดคำ

บทความนี้ว่าด้วยการให้คะแนนบทถอดภาษาไทยในแบบที่เทียบสองโมเดลได้ ครอบคลุมว่าตัวตัดคำทำอะไรกับตัวเลข ควรใช้เมตริกใดแทน ต้องทำอะไรให้เป็นมาตรฐานก่อนนับ และสร้างชุดทดสอบจากเสียงที่คุณมีอยู่แล้วอย่างไร บทความนี้ไม่ให้ตัวเลขของโมเดลใดเลย รวมถึงของเรา ตัวเลขที่ไม่มีวิธีวัดอยู่ข้างกันคือปัญหาที่บทความนี้พูดถึง

ตัวตัดคำทำอะไรกับตัวเลข#

ลองใช้บทอ้างอิงหนึ่งบรรทัดกับผลลัพธ์หนึ่งบรรทัดที่ต่างกันเพียงหนึ่งพยางค์ ให้คะแนนด้วยตัวตัดคำภาษาไทยที่ใช้กันทั่วไปสองตัว ตัวหนึ่งมองว่างบประมาณเป็นหนึ่งคำ อีกตัวแยกเป็นงบกับประมาณ ความผิดพลาดเดียวกันให้ WER ต่างกันในแต่ละตัว และไม่มีตัวไหนผิด

หนึ่งข้อผิดพลาด สามคะแนน
reference    วันนี้ประชุมเรื่องงบประมาณปีหน้า
hypothesis   วันนี้ประชุมเรื่องงบประมานปีหน้า

tokenizer A  วันนี้ | ประชุม | เรื่อง | งบประมาณ | ปีหน้า      5 words
tokenizer B  วัน | นี้ | ประชุม | เรื่อง | งบ | ประมาณ | ปี | หน้า   8 words

one wrong syllable in งบประมาณ
  WER under A   1 / 5  = 20%
  WER under B   1 / 8  = 12.5%
  CER           1 / 32 = 3.1%

ค่า WER ภาษาไทยที่เผยแพร่จึงมีตัวแปรซ่อนอยู่ ผู้ให้บริการสองรายที่ให้คะแนนด้วยตัวตัดคำสองตัวเทียบกันไม่ได้ และตัวเลขของรายเดียวทำซ้ำไม่ได้หากไม่ระบุตัวตัดคำ ตัวตัดคำที่แยกละเอียดกว่าลดตัวเลขให้ทุกคน

Character error rate#

Character error rate นับการดำเนินการสามอย่างเดิมบนตัวอักษร ตัวอักษรไทยมีขอบเขต การนับเหมือนกันบนทุกเครื่องและไม่ต้องใช้ตัวตัดคำ นี่คือเมตริกที่งานวิจัยเสียงพูดภาษาไทยส่วนใหญ่รายงาน และเป็นค่าที่ควรขอจากผู้ให้บริการเมื่อเขาอ้าง WER

CER มีค่าน้อยกว่าตัวเลขระดับคำสำหรับบทถอดเดียวกัน เพราะความผิดพลาดหนึ่งครั้งแตะตัวอักษรเดียวในคำที่มีหลายตัว สเกลต่างกันแต่การเปรียบเทียบยังใช้ได้ ตราบใดที่ทั้งสองโมเดลถูกให้คะแนนด้วยวิธีเดียวกันบนบทอ้างอิงชุดเดียวกัน

CER มีจุดบอดหนึ่งจุด วรรณยุกต์หรือสระบนที่เขียนผิดลำดับนับเป็นความผิดพลาดระดับตัวอักษร แม้คำที่แสดงผลจะดูถูกต้อง ทำลำดับยูนิโค้ดของทั้งสองข้อความให้เป็นมาตรฐานก่อนนับ แล้วจุดบอดนั้นจะปิดลง

ทำให้เป็นมาตรฐานก่อนนับ#

บทถอดกับบทอ้างอิงต่างกันในเรื่องที่เป็นเพียงธรรมเนียม และคะแนนที่นับสิ่งเหล่านั้นคือการวัดธรรมเนียม ตัดสินแต่ละข้อก่อนให้คะแนน และใช้กฎเดียวกันกับทั้งสองฝั่ง

  • ตัวเลข บทอ้างอิงที่เขียนเป็นตัวเลขกับผลลัพธ์ที่เขียนเป็นคำบอกจำนวนต่างกันทุกตัวอักษรของจำนวนนั้น เลือกรูปแบบเดียว API ถอดเสียงเขียนได้ทั้งสองแบบเมื่อร้องขอ และแบบพูดตรงกับบทอ้างอิงที่พิมพ์จากเสียง
  • ช่องว่าง การเว้นวรรคระหว่างวลีในภาษาไทยไม่สม่ำเสมอระหว่างคนพิมพ์สองคน ลบช่องว่างทั้งหมดก่อนนับ หรือนับช่องว่างแยกเป็นตัวเลขของตัวเอง
  • ไม้ยมก ๆ กับคำที่เขียนสองครั้งคือเสียงพูดเดียวกัน ขยายเครื่องหมายทั้งสองฝั่ง
  • เครื่องหมายวรรคตอนและตัวพิมพ์ในคำอังกฤษ ประโยคไทยที่สลับเป็นอังกฤษพาธรรมเนียมอังกฤษมาด้วย แปลงเป็นตัวพิมพ์เล็กและตัดเครื่องหมายวรรคตอนทั้งสองฝั่ง
  • คำเติม บทอ้างอิงคำต่อคำเก็บเอ่อไว้ และแบบเรียบเรียงตัดออก ให้คะแนนผลลัพธ์คำต่อคำกับบทอ้างอิงคำต่อคำ สไตล์เรียบเรียงเป็นทางเลือกเพื่อความอ่านง่าย และได้คะแนนแย่กว่าเมื่อเทียบกับบทอ้างอิงคำต่อคำโดยธรรมชาติ

สร้างชุดทดสอบจากเสียงของคุณเอง#

ชุดทดสอบของผู้ให้บริการฟังดูเหมือนข้อมูลของผู้ให้บริการ ชุดของคุณฟังดูเหมือนสายโทรศัพท์ การประชุม หรือคาบเรียนของคุณ พร้อมชื่อสินค้าและผู้พูดของคุณ ไฟล์ห้าสิบไฟล์ ยาวสองถึงห้านาที เลือกให้ครอบคลุมผู้พูด ห้อง และหัวข้อที่คุณมี คือชุดทดสอบที่ตัดสินโมเดลได้

ให้คนพิมพ์บทอ้างอิงขณะฟังเสียง ภายใต้กฎที่เขียนไว้สำหรับแต่ละข้อในรายการข้างบน ให้คนที่สองตรวจตัวอย่าง บทอ้างอิงที่มีความผิดพลาดของตัวเองห้าเปอร์เซ็นต์ แยกความต่างสองจุดระหว่างสองโมเดลไม่ได้

เก็บบทอ้างอิงกับเสียงไว้ด้วยกัน และให้คะแนนโมเดลผู้ท้าชิงทุกตัวบนชุดทั้งหมดด้วยสคริปต์เดียว รายงาน CER กฎการทำให้เป็นมาตรฐาน และขนาดของชุด ผู้อ่านที่มีทั้งสามอย่างทำซ้ำตัวเลขได้ และตัวเลขที่ผู้อ่านทำซ้ำได้คือตัวเลขที่เชื่อถือได้

เราเผยแพร่อะไร#

Paxa STT Lite ไม่เผยแพร่ตัวเลขความแม่นยำของตัวเอง วิธีประเมินมาก่อน และตัวเลขจะตามมาเฉพาะเมื่อมีชุดข้อมูลและกฎที่ผลิตมันอยู่ข้างกัน จนกว่าจะถึงตอนนั้น ไฟล์เสียงบนหน้าผลิตภัณฑ์และเครื่องมือถอดเสียงคือวิธีตัดสินโมเดลบนเสียงที่คุณเลือกเอง

ขั้นต่อไป#