ถอดเสียงข้อความเสียงภาษาไทยเป็นข้อความ
เปลี่ยนข้อความเสียงที่ทีมภาคสนามส่งมาเป็นข้อความภาษาไทยภายในชั่วโมงนั้น คำสั่งซื้อ ยอดเงิน และงานติดตามถูกจัดเก็บด้วยการค้นหา และออฟฟิศเลิกพิมพ์ซ้ำ
บทถอดเสียงเขียนว่าอย่างไร
เยี่ยมลูกค้า
spokenร้านป้าแดงสั่งเพิ่ม สองลัง ส่งวันจันทร์ ยอดค้างเดือนก่อน สามพันห้า ยังไม่จ่ายนะ
writtenร้านป้าแดงสั่งเพิ่ม 2 ลัง ส่งวันจันทร์ ยอดค้างเดือนก่อน 3,500 ยังไม่จ่ายนะ
แบบเขียนใส่จำนวนและยอดค้างเป็นตัวเลข กฎคำสั่งซื้ออ่านตัวแรก และกฎติดตามหนี้อ่านตัวหลัง
งานซ่อม
spokenเปลี่ยน compressor เรียบร้อย แต่ตัว thermostat ยังไม่มีของ นัดกลับมาอีก สองอาทิตย์
writtenเปลี่ยน compressor เรียบร้อย แต่ตัว thermostat ยังไม่มีของ นัดกลับมาอีก 2 อาทิตย์
ชื่ออะไหล่ยังคงเป็นอังกฤษทั้งสองแบบ คลังคำศัพท์ชื่ออะไหล่ช่วยให้สะกดเหมือนกันทั้งทีม
เยี่ยมเคลม
spokenรถลูกค้าเสียหายด้านหน้าซ้าย ประเมินเบื้องต้น หนึ่งหมื่นสองพันบาท ถ่ายรูปไว้แล้ว หกรูป
writtenรถลูกค้าเสียหายด้านหน้าซ้าย ประเมินเบื้องต้น 12,000 บาท ถ่ายรูปไว้แล้ว 6 รูป
ยอดประเมินและจำนวนรูปเป็นตัวเลขในบรรทัดแบบเขียน บันทึกเคลมรับทั้งสองค่าโดยไม่มีใครต้องพิมพ์ซ้ำ
บทถอดทุกคู่บนหน้านี้เป็นตัวอย่างที่เขียนขึ้นเพื่อแสดงว่าตัวเลือกรูปแบบเปลี่ยนอะไร และตรวจกับผลลัพธ์จริงก่อนเผยแพร่ หน้า Speech-to-Text มีบทถอดจริงของโมเดลจากไฟล์เสียงจริง พร้อมวันที่บันทึก
เชื่อมกับทีมภาคสนามอย่างไร
พนักงานขายออกจากร้านลูกค้า แล้วอัดโน้ตเสียงสี่สิบวินาทีก่อนขับรถต่อ ช่างอัดว่าซ่อมอะไรไปและอะไหล่ตัวไหนยังไม่มี ตัวแทนประกันอัดรายงานเยี่ยมเคลมจากลานจอดรถ โน้ตเหล่านี้ไปถึงกลุ่มแชต และคนในออฟฟิศฟังทีละอันแล้วพิมพ์ตาม การถอดเสียงตัดการพิมพ์ซ้ำออกไป แต่ละโน้ตกลายเป็นข้อความภายในไม่กี่วินาทีหลังส่ง ยอดเงิน วันที่ และชื่อลูกค้าอยู่ในข้อความ กฎหนึ่งข้อจัดเก็บโน้ตเข้าบัญชีที่ถูกต้อง การค้นหาข้ามโน้ตทั้งเดือนเจอทุกครั้งที่พูดถึงสินค้าหนึ่งตัว ไฟล์เสียงเก็บไว้ข้างข้อความ เผื่อวันที่รายละเอียดถูกโต้แย้ง
- ส่งต่อทุกโน้ตทันทีที่มาถึงส่งไฟล์เสียงที่แอปแชตบันทึกอยู่แล้ว ยาวเท่าไรก็ได้ถึง 60 นาที ระบบตรวจจับภาษาจากตัวโน้ตเอง
- ขอแบบเขียนจำนวน ยอดเงิน และวันที่มาเป็นตัวเลข กฎที่จัดเก็บจึงเรียบง่าย เพิ่มสไตล์เรียบเรียงเมื่อต้องการโน้ตที่อ่านได้ในแวบเดียว
- ส่งคลังคำศัพท์ของทีมชื่อสินค้า ชื่ออะไหล่ และร้านบนเส้นทาง ได้สูงสุด 50 คำ การสะกดจะเหมือนกันในโน้ตของพนักงานทุกคน
หนึ่งวันของพนักงานขาย โน้ตต่อโน้ต
แต่ละโน้ตคือหนึ่งคำขอ ระบบอ่านความยาวจากไฟล์ก่อนตัดเครดิต และโน้ตที่โมเดลอ่านไม่ได้ไม่มีค่าใช้จ่าย
ทุกโน้ตกลายเป็นอะไร
- บันทึกที่จัดเก็บแล้ว
- ชื่อลูกค้าและตัวเลขอยู่ในข้อความ กฎที่คุณเขียนส่งโน้ตเข้าบัญชีที่มันเป็นของ พร้อมไฟล์เสียงแนบ
- หนึ่งเดือนที่ค้นหาได้
- โน้ตทุกอันจากพนักงานทุกคนเป็นข้อความในดัชนีเดียว การค้นหาสินค้า ร้าน หรือคำหนึ่งคำเจอทุกครั้งที่พูดถึงทั้งทีม
- อ่านง่ายขึ้น
- สไตล์เรียบเรียงตัดคำเติมที่โน้ตพูดจากบนถนนมักมี ให้ข้อความอ่านได้ในแวบเดียว ใช้คำต่อคำเมื่อทุกคำสำคัญ
- ไฟล์เสียงยังอยู่
- เสียงอยู่ข้างข้อความ เมื่อตัวเลขถูกตั้งคำถาม วินาทีที่พูดอยู่ห่างแค่คลิกเดียว
โมเดลเขียนสิ่งที่พูด การจัดเก็บ การแจ้งเตือน และการค้นหาคือกฎที่คุณรันบนข้อความ
หนึ่งเดือนของทีมคิดเท่าไร
| ปริมาณงาน | เสียง | เครดิต |
|---|---|---|
| หนึ่งโน้ต 40 วินาที | 40 วินาที | 5.56 |
| หนึ่งวัน 30 โน้ต | 20 นาที | 166.8 |
| หนึ่งเดือน 660 โน้ต | 3,669.6 เครดิต | |
8.33 เครดิตต่อเสียงหนึ่งนาที คิดถึงระดับมิลลิวินาที เสียงโน้ต 7.3 ชั่วโมงตลอด 22 วันทำงานในอัตรานั้น ตัวเลือกของบทถอดไม่เปลี่ยนราคา
สำหรับนักพัฒนา
ตัวอย่างโค้ดส่งไฟล์บันทึกหนึ่งไฟล์พร้อมคลังคำศัพท์ แล้วอ่านบทถอดและเครดิตที่คิดจากคำตอบ
AUDIO=$(base64 < meeting.m4a | tr -d '\n')
curl -X POST https://api.paxalabs.com/v1/stt \
--max-time 300 \
-H "Authorization: Bearer $PAXA_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"audio\": \"$AUDIO\", \"model\": \"paxa-stt-lite-v1-preview\", \"language\": \"th\", \"vocabulary\": [\"Paxa Labs\", \"quarterly review\"]}"import { readFile } from "node:fs/promises";
const audio = (await readFile("meeting.m4a")).toString("base64");
const response = await fetch("https://api.paxalabs.com/v1/stt", {
method: "POST",
headers: {
Authorization: `Bearer ${process.env.PAXA_API_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({ audio, model: "paxa-stt-lite-v1-preview" }),
// A long recording can run for minutes; give it room.
signal: AbortSignal.timeout(300_000),
});
if (!response.ok) throw new Error(`Transcription failed: ${response.status}`);
const { text, usage } = await response.json();
console.log(text, `${usage.credits} credits`);import base64
import os
import requests
with open("meeting.m4a", "rb") as file:
audio = base64.b64encode(file.read()).decode()
response = requests.post(
"https://api.paxalabs.com/v1/stt",
headers={"Authorization": f"Bearer {os.environ['PAXA_API_KEY']}"},
json={"audio": audio, "model": "paxa-stt-lite-v1-preview"},
# A long recording can run for minutes; give it room.
timeout=300,
)
response.raise_for_status()
body = response.json()
print(body["text"], body["usage"]["credits"], "credits")โมเดลถูกสร้างมาให้ฟังอะไร
Paxa STT Lite ถอดเสียงภาษาไทยและอังกฤษ รวมโน้ตภาษาไทยที่เรียกชื่ออะไหล่เป็นอังกฤษ ตรวจจับภาษาของแต่ละไฟล์ได้เอง และจะไม่เผยแพร่ตัวเลขความแม่นยำจนกว่าจะเผยแพร่วิธีประเมินไว้ข้างกัน
คำถามที่พบบ่อย
- โน้ตสั้น ๆ ส่งทีละอันคุ้มไหม
- คุ้ม แต่ละคำขอคิดตามความยาวจริงของไฟล์ ขั้นต่ำหนึ่งในสิบเครดิต โน้ต 40 วินาทีคิด 5.56 เครดิต และการรวมส่งไม่เปลี่ยนอะไร
- ถ้าพนักงานพูดไทยปนอังกฤษในโน้ตเดียวล่ะ
- บทถอดเก็บทั้งสองภาษาตามที่พูด ชื่ออะไหล่ภาษาอังกฤษในประโยคไทยยังคงเป็นอังกฤษ และไม่ต้องส่งคำใบ้ภาษา
- ออฟฟิศเชื่อตัวเลขได้ไหม
- ตัวเลขคือสิ่งที่พูด เป็นดิจิตเมื่อใช้แบบเขียน ไฟล์เสียงอยู่ข้างข้อความ และวินาทีที่พูดตัวเลขนั้นเปิดเสียงขึ้นมาตรวจได้
- ถอดเสียงไม่สำเร็จคิดเงินไหม
- ไม่คิด ระบบตัดเครดิตก่อนแล้วคืนให้อัตโนมัติเมื่อคำขอล้มเหลว และไฟล์ที่โมเดลอ่านไม่ได้จะถูกปฏิเสธก่อนตัดเครดิต
เริ่มต้นด้วยเครดิตฟรี
เข้าสู่ระบบด้วย Google, GitHub หรือ Hugging Face แล้วใช้เครดิตฟรี 100 เครดิตกับข้อความของคุณเอง
ตัวอย่างการใช้งานอื่น