วัดความแม่นยำของการถอดเสียงภาษาไทย: ทำไม WER จึงหลอกตา
Word error rate ต้องการขอบเขตคำ และภาษาไทยเขียนโดยไม่มีขอบเขตนั้น วิธีให้คะแนนบทถอดภาษาไทยให้เทียบสองโมเดลได้ สิ่งที่ต้องทำให้เป็นมาตรฐานก่อน และวิธีสร้างชุดทดสอบจากเสียงของคุณเอง
· อ่าน 1 นาที
ผู้ให้บริการถอดเสียงทุกรายเผยแพร่ค่า word error rate และสำหรับภาษาไทย ตัวเลขนี้มีความหมายน้อยกว่าที่เห็น WER นับคำที่ถูกแทน ถูกลบ และถูกแทรก ระหว่างบทถอดอ้างอิงกับผลลัพธ์ของโมเดล หารด้วยจำนวนคำในบทอ้างอิง การนับต้องการขอบเขตคำ ภาษาอังกฤษใส่ช่องว่างที่ทุกขอบเขต ภาษาไทยใส่ช่องว่างท้ายวลีและไม่ใส่ที่อื่น และจุดที่คำหนึ่งจบภายในวลีเป็นการตัดสินใจของตัวตัดคำ
บทความนี้ว่าด้วยการให้คะแนนบทถอดภาษาไทยในแบบที่เทียบสองโมเดลได้ ครอบคลุมว่าตัวตัดคำทำอะไรกับตัวเลข ควรใช้เมตริกใดแทน ต้องทำอะไรให้เป็นมาตรฐานก่อนนับ และสร้างชุดทดสอบจากเสียงที่คุณมีอยู่แล้วอย่างไร บทความนี้ไม่ให้ตัวเลขของโมเดลใดเลย รวมถึงของเรา ตัวเลขที่ไม่มีวิธีวัดอยู่ข้างกันคือปัญหาที่บทความนี้พูดถึง
ตัวตัดคำทำอะไรกับตัวเลข#
ลองใช้บทอ้างอิงหนึ่งบรรทัดกับผลลัพธ์หนึ่งบรรทัดที่ต่างกันเพียงหนึ่งพยางค์ ให้คะแนนด้วยตัวตัดคำภาษาไทยที่ใช้กันทั่วไปสองตัว ตัวหนึ่งมองว่างบประมาณเป็นหนึ่งคำ อีกตัวแยกเป็นงบกับประมาณ ความผิดพลาดเดียวกันให้ WER ต่างกันในแต่ละตัว และไม่มีตัวไหนผิด
reference วันนี้ประชุมเรื่องงบประมาณปีหน้า hypothesis วันนี้ประชุมเรื่องงบประมานปีหน้า tokenizer A วันนี้ | ประชุม | เรื่อง | งบประมาณ | ปีหน้า 5 words tokenizer B วัน | นี้ | ประชุม | เรื่อง | งบ | ประมาณ | ปี | หน้า 8 words one wrong syllable in งบประมาณ WER under A 1 / 5 = 20% WER under B 1 / 8 = 12.5% CER 1 / 32 = 3.1%
ค่า WER ภาษาไทยที่เผยแพร่จึงมีตัวแปรซ่อนอยู่ ผู้ให้บริการสองรายที่ให้คะแนนด้วยตัวตัดคำสองตัวเทียบกันไม่ได้ และตัวเลขของรายเดียวทำซ้ำไม่ได้หากไม่ระบุตัวตัดคำ ตัวตัดคำที่แยกละเอียดกว่าลดตัวเลขให้ทุกคน
Character error rate#
Character error rate นับการดำเนินการสามอย่างเดิมบนตัวอักษร ตัวอักษรไทยมีขอบเขต การนับเหมือนกันบนทุกเครื่องและไม่ต้องใช้ตัวตัดคำ นี่คือเมตริกที่งานวิจัยเสียงพูดภาษาไทยส่วนใหญ่รายงาน และเป็นค่าที่ควรขอจากผู้ให้บริการเมื่อเขาอ้าง WER
CER มีค่าน้อยกว่าตัวเลขระดับคำสำหรับบทถอดเดียวกัน เพราะความผิดพลาดหนึ่งครั้งแตะตัวอักษรเดียวในคำที่มีหลายตัว สเกลต่างกันแต่การเปรียบเทียบยังใช้ได้ ตราบใดที่ทั้งสองโมเดลถูกให้คะแนนด้วยวิธีเดียวกันบนบทอ้างอิงชุดเดียวกัน
CER มีจุดบอดหนึ่งจุด วรรณยุกต์หรือสระบนที่เขียนผิดลำดับนับเป็นความผิดพลาดระดับตัวอักษร แม้คำที่แสดงผลจะดูถูกต้อง ทำลำดับยูนิโค้ดของทั้งสองข้อความให้เป็นมาตรฐานก่อนนับ แล้วจุดบอดนั้นจะปิดลง
ทำให้เป็นมาตรฐานก่อนนับ#
บทถอดกับบทอ้างอิงต่างกันในเรื่องที่เป็นเพียงธรรมเนียม และคะแนนที่นับสิ่งเหล่านั้นคือการวัดธรรมเนียม ตัดสินแต่ละข้อก่อนให้คะแนน และใช้กฎเดียวกันกับทั้งสองฝั่ง
- ตัวเลข บทอ้างอิงที่เขียนเป็นตัวเลขกับผลลัพธ์ที่เขียนเป็นคำบอกจำนวนต่างกันทุกตัวอักษรของจำนวนนั้น เลือกรูปแบบเดียว API ถอดเสียงเขียนได้ทั้งสองแบบเมื่อร้องขอ และแบบพูดตรงกับบทอ้างอิงที่พิมพ์จากเสียง
- ช่องว่าง การเว้นวรรคระหว่างวลีในภาษาไทยไม่สม่ำเสมอระหว่างคนพิมพ์สองคน ลบช่องว่างทั้งหมดก่อนนับ หรือนับช่องว่างแยกเป็นตัวเลขของตัวเอง
- ไม้ยมก ๆ กับคำที่เขียนสองครั้งคือเสียงพูดเดียวกัน ขยายเครื่องหมายทั้งสองฝั่ง
- เครื่องหมายวรรคตอนและตัวพิมพ์ในคำอังกฤษ ประโยคไทยที่สลับเป็นอังกฤษพาธรรมเนียมอังกฤษมาด้วย แปลงเป็นตัวพิมพ์เล็กและตัดเครื่องหมายวรรคตอนทั้งสองฝั่ง
- คำเติม บทอ้างอิงคำต่อคำเก็บเอ่อไว้ และแบบเรียบเรียงตัดออก ให้คะแนนผลลัพธ์คำต่อคำกับบทอ้างอิงคำต่อคำ สไตล์เรียบเรียงเป็นทางเลือกเพื่อความอ่านง่าย และได้คะแนนแย่กว่าเมื่อเทียบกับบทอ้างอิงคำต่อคำโดยธรรมชาติ
สร้างชุดทดสอบจากเสียงของคุณเอง#
ชุดทดสอบของผู้ให้บริการฟังดูเหมือนข้อมูลของผู้ให้บริการ ชุดของคุณฟังดูเหมือนสายโทรศัพท์ การประชุม หรือคาบเรียนของคุณ พร้อมชื่อสินค้าและผู้พูดของคุณ ไฟล์ห้าสิบไฟล์ ยาวสองถึงห้านาที เลือกให้ครอบคลุมผู้พูด ห้อง และหัวข้อที่คุณมี คือชุดทดสอบที่ตัดสินโมเดลได้
ให้คนพิมพ์บทอ้างอิงขณะฟังเสียง ภายใต้กฎที่เขียนไว้สำหรับแต่ละข้อในรายการข้างบน ให้คนที่สองตรวจตัวอย่าง บทอ้างอิงที่มีความผิดพลาดของตัวเองห้าเปอร์เซ็นต์ แยกความต่างสองจุดระหว่างสองโมเดลไม่ได้
เก็บบทอ้างอิงกับเสียงไว้ด้วยกัน และให้คะแนนโมเดลผู้ท้าชิงทุกตัวบนชุดทั้งหมดด้วยสคริปต์เดียว รายงาน CER กฎการทำให้เป็นมาตรฐาน และขนาดของชุด ผู้อ่านที่มีทั้งสามอย่างทำซ้ำตัวเลขได้ และตัวเลขที่ผู้อ่านทำซ้ำได้คือตัวเลขที่เชื่อถือได้
เราเผยแพร่อะไร#
Paxa STT Lite ไม่เผยแพร่ตัวเลขความแม่นยำของตัวเอง วิธีประเมินมาก่อน และตัวเลขจะตามมาเฉพาะเมื่อมีชุดข้อมูลและกฎที่ผลิตมันอยู่ข้างกัน จนกว่าจะถึงตอนนั้น ไฟล์เสียงบนหน้าผลิตภัณฑ์และเครื่องมือถอดเสียงคือวิธีตัดสินโมเดลบนเสียงที่คุณเลือกเอง
ขั้นต่อไป#
- อ่านคู่มือการถอดเสียง สำหรับรูปแบบการเขียนและตัวเลือกสไตล์ที่กฎการทำให้เป็นมาตรฐานข้างบนพึ่งพา
- อ่านบทความเรื่องตัวเลข ว่าแบบพูดกับแบบเขียนต่างกันอย่างไรทีละบรรทัด
- เปิดเครื่องมือถอดเสียง แล้วรันไฟล์ของคุณเองสักสองสามไฟล์ก่อนเขียนบทอ้างอิงแม้แต่บรรทัดเดียว