Paxa Labs

การรู้จำเสียงพูดภาษาไทย ภาษาที่เขียนติดกันไม่เว้นวรรค

ASR การรู้จำเสียงพูด แปลงเสียงเป็นข้อความ ถอดเสียง สี่ชื่อของงานเดียวกัน และในภาษาไทยงานนี้มีโจทย์สามข้อที่ภาษาอังกฤษไม่มี

การรู้จำเสียงพูดอัตโนมัติเปลี่ยนไฟล์เสียงให้เป็นข้อความ ทุกเอนจินทำสองอย่างเหมือนกัน คือตัดสินว่าพูดว่าอะไร และตัดสินว่าจะเขียนออกมาอย่างไร ในภาษาอังกฤษครึ่งหลังแทบไม่มีต้นทุน เพราะเสียงของคำกับรูปเขียนเดินไปด้วยกัน และช่องว่างบอกว่าคำหนึ่งจบตรงไหน

ภาษาไทยเทความยากทั้งหมดไว้ที่ครึ่งหลัง ระบบเขียนวางคำติดกัน วิธีอ่านตัวเลขต่างจากวิธีพิมพ์ และประโยคไทยธรรมดามีภาษาอังกฤษอยู่ข้างใน เอนจินที่ทำภาษาอังกฤษได้ดีจึงยังคืนข้อความไทยที่ค้นหาอะไรไม่ได้ออกมาได้

ชื่อเรียกของมัน#

ชื่อเหล่านี้ปรากฏทั้งในหน้าสินค้า งานวิจัย และเอกสาร API บางครั้งหมายถึงสิ่งเดียวกัน บางครั้งหมายถึงส่วนหนึ่งของมัน

การรู้จำเสียงพูดอัตโนมัติ (ASR)

เรียกอีกอย่างว่า speech recognition, การรู้จำเสียงพูด

ชื่อของสาขาวิชา และเป็นคำที่งานวิจัยใช้ ระบบ ASR รับเสียงเข้าไปแล้วคืนคำที่อยู่ในเสียงนั้นออกมา
แปลงเสียงเป็นข้อความ

เรียกอีกอย่างว่า speech to text, STT

ชื่อทางผลิตภัณฑ์ของสิ่งเดียวกัน API ที่เรียกตัวเองว่า speech to text กับที่เรียกว่า ASR ทำงานอย่างเดียวกัน
ถอดเสียง

เรียกอีกอย่างว่า ถอดความ, transcription

ทั้งผลลัพธ์และการลงมือทำ คำที่ตรงความหมายคือ ถอดเสียง ส่วน ถอดความภาษาไทย ถูกใช้กันกว้างขวางสำหรับคำขอเดียวกันนี้
เวลาระดับคำ

เรียกอีกอย่างว่า word timestamps, ช่วงเวลาของคำ

วินาทีเริ่มและวินาทีจบของทุกคำ คำบรรยาย เครื่องเล่นแบบอ่านตาม และการค้นหาเพื่อกระโดดไปยังนาทีที่ต้องการ สร้างจากสิ่งนี้ทั้งหมด
การแยกผู้พูด

เรียกอีกอย่างว่า diarization, ช่วงผู้พูด

การทำเครื่องหมายว่าใครพูดช่วงไหน บทถอดถูกแบ่งเป็นช่วงและนับหมายเลขตามลำดับที่ปรากฏครั้งแรก โดยไม่อ้างว่ารู้ว่าเป็นใคร
อัตราความผิดพลาดระดับคำ (WER)

เรียกอีกอย่างว่า word error rate

มาตรวัดความแม่นยำมาตรฐาน นับคำที่แทนที่ ตกหล่น และเกินมา เทียบกับจำนวนคำที่พูดจริง
อัตราความผิดพลาดระดับตัวอักษร (CER)

เรียกอีกอย่างว่า character error rate

มาตรวัดเดียวกันแต่นับเป็นตัวอักษร ผลของภาษาไทยมักรายงานแบบนี้ ด้วยเหตุผลที่อยู่ถัดลงไป

ภาษาไทยต่างออกไปตรงไหน#

คุณสมบัติสามข้อของภาษา แต่ละข้อเปลี่ยนสิ่งที่เราขอจากระบบรู้จำเสียงได้อย่างซื่อตรง

ขอบเขตของคำในภาษาไทยคือการตัดสินใจ และทุกมาตรวัดของบทถอดภาษาไทยรับการตัดสินใจนั้นมาเต็ม ๆ

นี่เป็นข้อเท็จจริงของระบบเขียน และเอนจินไหนก็แก้ด้วยการเก่งขึ้นไม่ได้

  1. 01

    คำเขียนติดกัน

    ภาษาไทยเว้นวรรคที่จบวลีและจบประโยค และโดยทั่วไปไม่เว้นระหว่างคำ การนับความผิดพลาดทีละคำจึงต้องตกลงก่อนว่าคำอยู่ตรงไหน ซึ่งเป็นการตัดสินใจของตัวตัดคำ ผลของภาษาไทยจึงรายงานเป็นตัวอักษร

    ที่มา:arXiv (2026)(opens in a new tab)SNLP (2007)(opens in a new tab)

  2. 02

    เสียงกับรูปเขียนแยกทางกัน

    การพูดย่อเสียง ตัวเลขที่พูดออกมาเป็นคำ ส่วนจำนวนเดียวกันพิมพ์เป็นดิจิต และคำซ้ำถูกพูดสองครั้งในที่ที่หน้ากระดาษพิมพ์ ๆ บทถอดจึงต้องเลือกแบบการเขียนแบบหนึ่งและยึดไว้

    ที่มา:HLT-NAACL (2006)(opens in a new tab)

  3. 03

    ภาษาอังกฤษโผล่กลางประโยค

    คนไทยเรียกศัพท์เทคนิค ชื่อแบรนด์ หรือชื่อสินค้าเป็นภาษาอังกฤษโดยไม่เปลี่ยนประโยค บทถอดจึงเก็บสองระบบเขียนไว้ในบรรทัดเดียว และคำสองฝั่งของจุดสลับก็ยังต้องมีวินาทีของตัวเอง

    ที่มา:HASSS (2023)(opens in a new tab)

บทถอดภาษาไทยควรมีอะไรติดมา#

สี่สิ่งที่ระบบรู้จำเสียงคืนได้ และแต่ละอย่างมีค่าอย่างไรเมื่อข้อความเข้าไปอยู่ในผลิตภัณฑ์แล้ว

Paxa STT Lite คืนครบทั้งสี่อย่าง รับไฟล์ยาวได้ถึง 60 นาที ทั้งภาษาไทยและอังกฤษ และตัวเลือกเหล่านี้ไม่เปลี่ยนค่าบริการ โมเดลนี้เป็นพรีวิวงานวิจัย บทถอดและตัวเลือกอาจเปลี่ยนแปลงได้ในรุ่นถัดไป

คำถามที่พบบ่อย#

ASR กับ speech to text เหมือนกันไหม
เหมือนกัน ASR เป็นชื่อทางงานวิจัย ส่วน speech to text เป็นชื่อทางผลิตภัณฑ์ หน้าที่ขาย API ชื่อ ASR กับหน้าที่ขาย API ชื่อ speech to text อธิบายงานเดียวกัน
ทำไมความแม่นยำภาษาไทยรายงานเป็นตัวอักษร
อัตราความผิดพลาดระดับคำนับความผิดพลาดทีละคำ และภาษาไทยไม่ได้ทำเครื่องหมายว่าคำจบตรงไหน ตัวตัดคำสองตัวแบ่งประโยคเดียวกันคนละแบบ แล้วให้คะแนนสองค่าแก่บทถอดเดียว การนับตัวอักษรจึงนิ่งกว่า และงานวิจัยไทยรายงานแบบนั้น
เผยแพร่ตัวเลขความแม่นยำหรือเปล่า
ตัวเลขจะไม่ออกไปโดยไม่มีวิธีวัดอยู่ข้างกัน อัตราความผิดพลาดที่ยกมาโดยไม่บอกชุดไฟล์เสียง ตัวตัดคำ และแบบการเขียน คือตัวเลขที่ตรวจสอบและทำซ้ำไม่ได้
บทถอดภาษาไทยเก็บคำภาษาอังกฤษไว้ไหม
เขียนตามที่พูด ประโยคไทยที่สลับเป็นอังกฤษเพื่อเรียกศัพท์จะเก็บศัพท์นั้นเป็นอังกฤษ และช่วงเวลาของคำครอบคลุมทั้งสองระบบเขียน
ถอดความ หมายถึงอะไร
ในภาษาไทยที่ใช้อย่างระมัดระวัง ถอดเสียง คือการเปลี่ยนเสียงเป็นข้อความ ส่วน ถอดความ คือการถ่ายทอดความหมาย ทั้งสองคำถูกพิมพ์ลงช่องค้นหาเพื่อขอสิ่งเดียวกัน และหน้านี้ตอบได้ทั้งสองคำ
ลองใช้โดยไม่เขียนโค้ดได้ไหม
เข้าสู่ระบบแล้วอัปโหลดไฟล์เสียงในคอนโซล เครดิตฟรีครอบคลุมไฟล์แรก และบทถอดกลับมาพร้อมช่วงเวลาของคำและเลือกได้ทั้งสองแบบการเขียน

ลองกับไฟล์เสียงของคุณเอง

เครดิตฟรีครอบคลุมไฟล์แรก ได้ทั้งเวลาระดับคำ ช่วงผู้พูด และแบบการเขียนที่เลือกเอง โดยไม่ต้องผูกบัตร