blognone.com
เปิดตัวโมเดลถอดเสียง MAI-Transcribe-2-Streaming ผิดพลาดต่ำสุดในตลาด, MAI-Voice-2.1 รองรับภาษาไทย
เปิดตัวโมเดลถอดเสียง MAI-Transcribe-2-Streaming ผิดพลาดต่ำสุดในตลาด, MAI-Voice-2.1 รองรับภาษาไทย
Body
Microsoft AI เปิดตัวโมเดลตระกูล MAI สายเสียงใหม่พร้อมกัน 3 ตัว ดังนี้
* **MAI-Transcribe-2-Streaming** เป็นโมเดลถอดเสียงพูด สายย่อยของ MAI‑Transcribe‑2 เน้นการถอดเสียงแบบเรียลไทม์ ค่า latency ต่ำที่ประมาณ 100ms รองรับ 60 ภาษา มีอัตราความผิดพลาด 2.5% ต่ำที่สุดในท้องตลาดตอนนี้, ค่าใช้งาน 0.54 ดอลลาร์ต่อเสียงพูด 1 ชั่วโมง
* **MAI-Voice-2.1** โมเดลสร้างเสียงพูดเวอร์ชันอัพเกรดจาก MAI-Voice-2 เพิ่มภาษาที่รองรับจาก 15 ภาษาเป็น 23 ภาษา ตอนนี้มีภาษาไทยเรียบร้อยแล้ว, ค่าใช้งาน 22 ดอลลาร์ต่อ 1 ล้านตัวอักษร
* **MAI-Voice-2.1-Flash** โมเดลเวอร์ชันถูกของ MAI-Voice-2.1 เน้นลูกค้าที่ต้องการสร้างเสียงเยอะๆ และทำงานเร็ว, ค่าใช้งาน 15 ดอลลาร์ต่อ 1 ล้านตัวอักษร
โมเดลทั้ง 3 ตัวเปิดใช้งานแล้วผ่าน Microsoft Foundry และ OpenRouter
ที่มา - Microsoft
mk Fri, 02/10/2026 - 21:02