Paxa Labs
ตัวอย่างการใช้งานทั้งหมด

ถอดเสียงสัมภาษณ์ภาษาไทยเป็นข้อความ

เปลี่ยนบันทึกเสียงสัมภาษณ์เป็นข้อความภาษาไทย พร้อมหมายเลขผู้พูดและวินาทีในทุกบรรทัด ค้นหาคำพูดได้ เริ่มลงรหัสได้ในวันเดียวกัน และไฟล์เสียงยังคงเป็นหลักฐาน

บทถอดเสียงเขียนว่าอย่างไร

คำตอบจากการวิจัยผู้ใช้

spokenตอนแรกก็ลองใช้แอปอยู่ ประมาณสองอาทิตย์ แล้วก็เลิกใช้ เพราะมันโหลดช้ามาก

writtenตอนแรกก็ลองใช้แอปอยู่ ประมาณ 2 อาทิตย์ แล้วก็เลิกใช้ เพราะมันโหลดช้ามาก

แบบพูดเก็บคำตอบตามที่พูด ซึ่งเป็นสิ่งที่การยกคำพูดคำต่อคำต้องการ แบบเขียนใส่ระยะเวลาเป็นตัวเลข

แหล่งข่าวให้สัมภาษณ์

spokenงบประมาณปีนี้ตั้งไว้ที่ หนึ่งร้อยยี่สิบล้านบาท และจะเริ่มเบิกจ่ายในเดือน ตุลาคม

writtenงบประมาณปีนี้ตั้งไว้ที่ 120 ล้านบาท และจะเริ่มเบิกจ่ายในเดือน ตุลาคม

นักข่าวยกคำพูดจากแบบพูด และส่งต้นฉบับด้วยแบบเขียน ทั้งสองแบบมีวินาทีที่ตัวเลขถูกพูด

ผู้สมัครตอบกลางประโยค

spokenที่ทีมเก่าผมดูแล pipeline ของ data ทั้งหมด ประมาณ สิบห้า ตัว

writtenที่ทีมเก่าผมดูแล pipeline ของ data ทั้งหมด ประมาณ 15 ตัว

ศัพท์อังกฤษยังคงเป็นอังกฤษทั้งสองแบบ คลังคำศัพท์ชื่อตำแหน่งและเครื่องมือช่วยให้สะกดเหมือนกันทุกคน

บทถอดทุกคู่บนหน้านี้เป็นตัวอย่างที่เขียนขึ้นเพื่อแสดงว่าตัวเลือกรูปแบบเปลี่ยนอะไร และตรวจกับผลลัพธ์จริงก่อนเผยแพร่ หน้า Speech-to-Text มีบทถอดจริงของโมเดลจากไฟล์เสียงจริง พร้อมวันที่บันทึก

เชื่อมกับการศึกษาอย่างไร

ทีมวิจัยบันทึกเสียงสัมภาษณ์สามสิบคน แล้วใช้เวลาอีกหนึ่งเดือนพิมพ์ทั้งหมด กองบรรณาธิการอัดเสียงกับแหล่งข่าวหนึ่งชั่วโมง แล้วยกคำพูดมาสี่ประโยคจากความจำ กรรมการสัมภาษณ์งานอัดเสียงผู้สมัครทุกคน แล้วเปรียบเทียบจากความรู้สึก การถอดเสียงย้ายงานจากหูมาที่หน้ากระดาษ แต่ละบทสัมภาษณ์กลายเป็นข้อความทันทีที่จบ ทุกคำมีวินาที และทุกช่วงพูดมีหมายเลขผู้พูด คำพูดที่ต้องการหาได้ด้วยการค้นหา และตรวจกับเสียงตรงวินาทีที่พูด การลงรหัสเริ่มได้ตั้งแต่วันแรก บทถอดเก็บภาษาตามที่พูด ศัพท์อังกฤษในคำตอบภาษาไทยจึงมาถึงครบ

  1. ส่งไฟล์ทุกไฟล์โดยเปิดแยกผู้พูดส่งไฟล์ตามที่ได้จากการโทร ยาวได้ถึง 60 นาที การแยกผู้พูดมาจากการอ่านไฟล์รวดเดียว จึงต้องใช้ไฟล์ที่สั้นกว่า 9 นาที ให้ตัดบทสัมภาษณ์ยาวตรงช่วงหยุด แล้วส่งแต่ละส่วนโดยเปิดแยกผู้พูด ระบบอ่านความยาวก่อนตัดเครดิต ไฟล์ที่โมเดลอ่านไม่ได้ถูกปฏิเสธก่อนตัดเครดิต
  2. ขอเวลาระดับคำทุกคำมีวินาที คำพูดในรายงานลิงก์ไปยังช่วงเวลานั้น ใช้แบบพูดสำหรับคำพูดคำต่อคำ และแบบเขียนสำหรับตัวเลข
  3. ส่งคลังคำศัพท์ของการศึกษาชื่อสินค้า ชื่อสถานที่ และคำที่แนวคำถามใช้ ได้สูงสุด 50 คำ การสะกดจะเหมือนกันในทุกบทถอด

ทุกบทสัมภาษณ์กลายเป็นอะไร

0 และ 1
ผู้พูด
เมื่อเปิดแยกผู้พูด แต่ละช่วงพูดจะมีหมายเลขผู้พูด นับจาก 0 ตามลำดับที่ปรากฏ ผู้สัมภาษณ์เป็นหมายเลขเดิมในทุกไฟล์ที่ตัวเองเปิด และคำตอบเป็นอีกหมายเลข
คำพูดพร้อมวินาที
ขอเวลาระดับคำ แล้วทุกคำจะมีเวลาเริ่มและจบ คำพูดในรายงานลิงก์ไปยังวินาทีที่พูด ผู้ตรวจเปิดฟังเฉพาะตรงนั้น
ลงรหัสได้ตั้งแต่วันแรก
ธีมถูกทำเครื่องหมายบนข้อความ บทถอดพร้อมในวันเดียวกับที่บันทึก และสมุดรหัสเติบโตระหว่างที่การศึกษายังดำเนินอยู่
ไฟล์เสียงยังเป็นหลักฐาน
บทถอดคือสำเนาที่ใช้ทำงาน เมื่อบรรทัดใดสำคัญ วินาทีข้างบรรทัดเปิดเสียงขึ้นมา และข้อความถูกตรวจกับเสียงจริง

โมเดลเขียนสิ่งที่พูด ธีม คำพูดที่ยกมา และคะแนนเป็นของคุณที่ทำเครื่องหมายบนข้อความ

หนึ่งการศึกษา สัปดาห์ต่อสัปดาห์

01หาผู้ให้สัมภาษณ์และบันทึกสัมภาษณ์ผ่านวิดีโอคอลหรือโทรศัพท์ ส่งไฟล์ทันทีที่จบ ยาวได้ถึง 60 นาทีต่อคำขอ โดยเปิดแยกผู้พูด
02อ่านระหว่างที่ยังบันทึกต่อบทถอดสิบชุดแรกถูกอ่านก่อนการสัมภาษณ์สิบคนสุดท้าย คำถามที่ได้คำตอบบางถูกเขียนใหม่กลางการศึกษา
03ลงรหัสทั้งชุดบทถอดทุกชุดอยู่ในโฟลเดอร์เดียว พร้อมหมายเลขผู้พูดและวินาที ธีมถูกทำเครื่องหมายบนข้อความ และจำนวนต่อธีมคือการค้นหาหนึ่งครั้ง
04เขียนพร้อมคำพูดที่ยกมาคำพูดแต่ละบรรทัดในรายงานระบุบทสัมภาษณ์และวินาที ผู้อ่านที่เข้าถึงเสียงได้ตรวจบรรทัดใดก็ได้ในคลิกเดียว

เวลาระดับคำและช่วงผู้พูดส่งในคำขอเดียวกัน ทั้งสองอย่างไม่เปลี่ยนราคา

หนึ่งการศึกษาคิดเท่าไร

ปริมาณงานเสียงเครดิต
หนึ่งบทสัมภาษณ์ 45 นาที45 นาที375
สิบบทสัมภาษณ์7.5 ชม.3,750
หนึ่งการศึกษา 30 บทสัมภาษณ์11,250 เครดิต

8.33 เครดิตต่อเสียงหนึ่งนาที คิดถึงระดับมิลลิวินาที เสียงสัมภาษณ์ 22.5 ชั่วโมงในอัตรานั้น ช่วงผู้พูดและเวลาระดับคำไม่มีค่าใช้จ่ายเพิ่ม

สำหรับนักพัฒนา

ตัวอย่างโค้ดส่งไฟล์บันทึกหนึ่งไฟล์โดยเปิดแยกผู้พูด แล้วอ่านบทถอด ช่วงผู้พูด และเครดิตที่คิดจากคำตอบ

AUDIO=$(base64 < meeting.m4a | tr -d '\n')
curl -X POST https://api.paxalabs.com/v1/stt \
  --max-time 300 \
  -H "Authorization: Bearer $PAXA_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{\"audio\": \"$AUDIO\", \"model\": \"paxa-stt-lite-v1-preview\", \"diarization\": true}"

เอกสารอ้างอิง API ฉบับเต็ม

โมเดลถูกสร้างมาให้ฟังอะไร

Paxa STT Lite ถอดเสียงภาษาไทยและอังกฤษ รวมคำตอบที่สลับภาษากลางทาง ระบุช่วงพูดเป็นหมายเลขเมื่อร้องขอโดยไม่เขียนชื่อใคร และจะไม่เผยแพร่ตัวเลขความแม่นยำจนกว่าจะเผยแพร่วิธีประเมินไว้ข้างกัน

คำถามที่พบบ่อย

บทถอดแยกผู้สัมภาษณ์กับผู้ให้สัมภาษณ์ได้ไหม
แยกเป็นหมายเลข แต่ละช่วงพูดมีหมายเลขผู้พูด นับจาก 0 ตามลำดับที่ปรากฏ ในการสัมภาษณ์ตัวต่อตัว ผู้สัมภาษณ์มักเป็นเสียงแรก และข้อมูลของไฟล์เองบอกว่าเป็นใคร
บทสัมภาษณ์ที่ยาวเกินหนึ่งชั่วโมงทำอย่างไร
หนึ่งคำขอรับได้ถึง 60 นาที และต้องสั้นกว่า 9 นาทีเมื่อเปิดแยกผู้พูด ตัดไฟล์ที่ยาวกว่านั้นตรงช่วงหยุด ส่งแต่ละส่วนพร้อมกัน แล้วเลื่อนวินาทีของแต่ละส่วนตามเวลาเริ่มของส่วนนั้น แต่ละส่วนนับหมายเลขผู้พูดจาก 0 ใหม่ จึงต้องจับคู่หมายเลขข้ามส่วนตามลำดับที่แต่ละเสียงเข้ามา
เสียงของผู้ให้สัมภาษณ์เป็นความลับไหม
บทถอดส่งกลับถึงคุณ และบันทึกการใช้งานเก็บเฉพาะจำนวนและการตั้งค่า ข้อมูลเข้าและผลลัพธ์ถูกเก็บไว้โดยไม่ผูกกับตัวตนบัญชี เพื่อฝึกโมเดล นโยบายความเป็นส่วนตัวระบุไว้
ถอดเสียงไม่สำเร็จคิดเงินไหม
ไม่คิด ระบบตัดเครดิตก่อนแล้วคืนให้อัตโนมัติเมื่อคำขอล้มเหลว และไฟล์ที่โมเดลอ่านไม่ได้จะถูกปฏิเสธก่อนตัดเครดิต

เริ่มต้นด้วยเครดิตฟรี

เข้าสู่ระบบด้วย Google, GitHub หรือ Hugging Face แล้วใช้เครดิตฟรี 100 เครดิตกับข้อความของคุณเอง