ถอดเสียงวิทยุและโทรทัศน์ภาษาไทยเป็นข้อความ
เปลี่ยนเสียงวิทยุ โทรทัศน์ และพอดแคสต์ภาษาไทยให้เป็นข้อความที่ทีมค้นหาได้ หาทุกครั้งที่ชื่อหรือข้อความถูกพูดถึง พร้อมวินาทีที่พูด
บทถอดเสียงเขียนว่าอย่างไร
สปอตโฆษณาวิทยุ
spokenโปรโมชั่นพิเศษ ลดสูงสุด ห้าสิบ เปอร์เซ็นต์ ถึงสิ้นเดือน สิงหาคม นี้เท่านั้น
writtenโปรโมชั่นพิเศษ ลดสูงสุด 50% ถึงสิ้นเดือนสิงหาคมนี้เท่านั้น
บรรทัดแคมเปญตามที่อ่านออกอากาศ แบบเขียนใส่ส่วนลดและวันสิ้นสุดในรูปที่รายงานพิมพ์จริง
ข่าวต้นชั่วโมง
spokenราคาน้ำมันดีเซลปรับขึ้น ห้าสิบ สตางค์ต่อลิตร มีผลตั้งแต่เที่ยงคืนวันที่ หนึ่ง กันยายน
writtenราคาน้ำมันดีเซลปรับขึ้น 50 สตางค์ต่อลิตร มีผลตั้งแต่เที่ยงคืนวันที่ 1 กันยายน
ตัวเลขกับวันที่อยู่ในประโยคเดียว ทีมที่ค้นหาอย่างใดอย่างหนึ่งเจอบรรทัดนี้ได้ทั้งสองแบบ
การพูดถึงในรายการสนทนา
spokenเมื่อวานผมลองใช้แอปตัวใหม่ที่เพื่อนแนะนำ ใช้ง่ายกว่าที่คิดเยอะเลยครับ
writtenเมื่อวานผมลองใช้แอปตัวใหม่ที่เพื่อนแนะนำ ใช้ง่ายกว่าที่คิดเยอะเลยครับ
การพูดถึงที่ไม่ได้จ่ายเงิน แทรกอยู่ในบทสนทนาธรรมดา สองแบบตรงกันตรงนี้ เพราะบรรทัดนี้ไม่มีตัวเลข
บทถอดทุกคู่บนหน้านี้เป็นตัวอย่างที่เขียนขึ้นเพื่อแสดงว่าตัวเลือกรูปแบบเปลี่ยนอะไร และตรวจกับผลลัพธ์จริงก่อนเผยแพร่ หน้า Speech-to-Text มีบทถอดจริงของโมเดลจากไฟล์เสียงจริง พร้อมวันที่บันทึก
ทีมรันงานนี้อย่างไร
ทีมแบรนด์อยากรู้ว่าชื่อของตัวเองถูกพูดถึงในวิทยุเมื่อเช้านี้ตอนไหน เอเจนซีต้องรายงานลูกค้าว่าแคมเปญถูกได้ยินที่ใดบ้าง ฝ่ายกำกับดูแลต้องเก็บบันทึกว่าอะไรออกอากาศไปแล้ว ทั้งสามโจทย์คือโจทย์เดียวกัน คือเสียงภาษาไทยหลายชั่วโมงที่ไม่มีใครมีเวลานั่งฟัง การถอดเสียงเปลี่ยนช่วงเวลาที่เฝ้าไว้ให้เป็นข้อความ รายชื่อที่เฝ้าถูกไล่บนข้อความ ผลที่เจอมีวินาทีที่ถูกพูดติดมา แล้วคลิปหลักฐานก็ตัดจากวินาทีนั้น ไฟล์เสียงยังเป็นตัวบันทึกเหมือนเดิม ส่วนข้อความคือสิ่งที่ทำให้บันทึกนั้นใช้งานได้ก่อนที่เรื่องจะผ่านไปแล้ว
- บันทึกช่วงเวลาที่คุณสนใจอยู่แล้วอัดชั่วโมงที่สำคัญไว้แล้วส่งทีละส่วน ได้ถึง 60 นาทีต่อคำขอ ระบบอ่านความยาวก่อนตัดเครดิต
- ขอเวลาระดับคำและแบบเขียนทุกคำมีวินาทีของตัวเอง และตัวเลขมาเป็นดิจิต คำตอบเดียวป้อนทั้งดัชนีค้นหาและเครื่องมือตัดคลิป
- ไล่รายการที่เฝ้าบนข้อความส่งชื่อแบรนด์และชื่อสินค้าเป็นคลังคำศัพท์ ได้ถึง 50 คำ แล้วจับคู่กับบทถอดในแบบของคุณเอง
หนึ่งช่วงเวลาที่เฝ้าไว้
เวลาระดับคำให้ทุกผลที่เจอมีวินาที ไฟล์เสียงยังเป็นตัวบันทึก และข้อความคือดัชนีที่พาเข้าไปหา
ทีมติดตามสื่อหนึ่งทีมคิดเท่าไร
| ปริมาณงาน | เสียง | เครดิต |
|---|---|---|
| หนึ่งสถานี หนึ่งช่วง 6 ชั่วโมง | 6 ชม. | 3,000 |
| หนึ่งวัน 4 สถานี | 24 ชม. | 12,000 |
| หนึ่งเดือน 22 วันทำการ | 264,000 เครดิต | |
8.33 เครดิตต่อเสียงหนึ่งนาที คิดถึงระดับมิลลิวินาที เสียงออกอากาศ 528 ชั่วโมงในอัตรานั้น เวลาระดับคำและแบบเขียนไม่มีค่าใช้จ่ายเพิ่ม
ไปป์ไลน์ต้องการอะไรจากบทถอด
- 60 นาที
- ต่อหนึ่งคำขอ
- ช่วงเวลาหนึ่งช่วงถูกส่งเป็นส่วนต่อเนื่อง โดยเลื่อนวินาทีของแต่ละส่วนตามนาทีที่เริ่ม
- word
- วินาทีของทุกผลที่เจอ
- นาทีที่ชื่อถูกพูดคือจุดที่ตัดคลิปหลักฐาน และเป็นสิ่งที่รายงานใช้อ้าง
- 50
- ชื่อในรายการที่เฝ้า
- ชื่อแบรนด์ สินค้า และบุคคล ใส่เป็นคลังคำศัพท์ จึงสะกดเหมือนกันในบทถอดของทุกสถานี
บทถอดบันทึกว่าอะไรออกอากาศ ส่วนข้อสรุปทางกฎหมายหรือทางสัญญาเป็นสิ่งที่ทีมต้องตัดสินเองจากบทถอดนั้น
สำหรับนักพัฒนา
ตัวอย่างโค้ดส่งไฟล์บันทึกหนึ่งไฟล์พร้อมรายการที่เฝ้าและเวลาระดับคำ แล้วอ่านบทถอด ช่วงเวลา และเครดิตที่คิด
AUDIO=$(base64 < meeting.m4a | tr -d '\n')
curl -X POST https://api.paxalabs.com/v1/stt \
--max-time 300 \
-H "Authorization: Bearer $PAXA_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"audio\": \"$AUDIO\", \"model\": \"paxa-stt-lite-v1-preview\", \"language\": \"th\", \"vocabulary\": [\"Paxa Labs\", \"quarterly review\"]}"AUDIO=$(base64 < meeting.m4a | tr -d '\n')
curl -X POST https://api.paxalabs.com/v1/stt \
--max-time 300 \
-H "Authorization: Bearer $PAXA_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"audio\": \"$AUDIO\", \"model\": \"paxa-stt-lite-v1-preview\", \"timestamps\": \"word\"}"import base64
import os
import requests
with open("meeting.m4a", "rb") as file:
audio = base64.b64encode(file.read()).decode()
response = requests.post(
"https://api.paxalabs.com/v1/stt",
headers={"Authorization": f"Bearer {os.environ['PAXA_API_KEY']}"},
json={"audio": audio, "model": "paxa-stt-lite-v1-preview"},
# A long recording can run for minutes; give it room.
timeout=300,
)
response.raise_for_status()
body = response.json()
print(body["text"], body["usage"]["credits"], "credits")โมเดลถูกสร้างมาให้ฟังอะไร
Paxa STT Lite ถอดเสียงภาษาไทยและอังกฤษ รวมประโยคไทยที่เรียกชื่อแบรนด์เป็นอังกฤษ เขียนเวลาระดับคำครอบคลุมทั้งคำภาษาไทย และจะไม่เผยแพร่ตัวเลขความแม่นยำจนกว่าจะเผยแพร่วิธีประเมินไว้ข้างกัน
คำถามที่พบบ่อย
- ติดตามสตรีมสดได้ไหม
- แต่ละคำขอรับไฟล์ที่บันทึกจบแล้ว ยาวได้ถึง 60 นาที ทีมที่อัดเป็นส่วนต่อเนื่องแล้วส่งทันทีที่แต่ละส่วนปิด จะได้ข้อความห่างจากเวลาจริงเพียงหนึ่งส่วน
- แยกเสียงผู้ดำเนินรายการได้ไหม
- การแยกผู้พูดใช้ได้กับไฟล์ที่สั้นกว่า และนับหมายเลขตามคนที่พูดก่อน ทีมติดตามสื่อส่วนใหญ่ต้องการคำและวินาทีของคำ ซึ่งได้ครบทุกความยาว
- ถ้าสถานีสลับไปพูดภาษาอังกฤษล่ะ
- เขียนไว้ทั้งสองภาษา ประโยคไทยที่เรียกชื่อแบรนด์หรือชื่อเพลงเป็นอังกฤษจะเก็บภาษาอังกฤษไว้ และคำสองฝั่งยังมีวินาทีของตัวเอง
- บทถอดใช้เป็นหลักฐานว่าออกอากาศอะไรได้ไหม
- ไฟล์บันทึกคือตัวบันทึก บทถอดเป็นดัชนีที่พาเข้าไปหา และทุกผลที่เจอมีวินาทีที่เปิดเสียงตรงจุดที่เป็นประเด็น
เริ่มต้นด้วยเครดิตฟรี
เข้าสู่ระบบด้วย Google, GitHub หรือ Hugging Face แล้วใช้เครดิตฟรี 100 เครดิตกับข้อความของคุณเอง