Whisper แปลงเสียงเป็นข้อความ — โมเดลโอเพนซอร์สของ OpenAI กับทางเลือกถอดเทปฟรี
Whisper คือโมเดลรู้จำเสียงพูดที่ OpenAI เปิดซอร์สภายใต้สัญญาอนุญาต MIT เมื่อเดือนกันยายน 2022 ใครก็สามารถรันบนคอมพิวเตอร์ของตัวเองได้ฟรี ไม่ต้องเสียเงิน ไม่ต้อง
Whisper คือโมเดลรู้จำเสียงพูดที่ OpenAI เปิดซอร์สภายใต้สัญญาอนุญาต MIT เมื่อเดือนกันยายน 2022 ใครก็สามารถรันบนคอมพิวเตอร์ของตัวเองได้ฟรี ไม่ต้องเสียเงิน ไม่ต้องอัปโหลดไฟล์เสียงขึ้นคลาวด์ โมเดลนี้ฝึกด้วยข้อมูลเสียงหลายภาษา 680,000 ชั่วโมง รองรับการรู้จำและแปล 99 ภาษา ความแม่นยำในการรู้จำภาษาจีน (รวมทั้งตัวเต็ม) อยู่ที่มากกว่า 95% เมื่อไฟล์บันทึกเสียงมีคุณภาพดี สำหรับบุคคลและทีมเล็กที่ต้องจัดการเสียงประชุม บทสัมภาษณ์ หรือวิดีโอคอร์สจำนวนมาก นี่คือทางเลือกถอดเทปที่มีต้นทุนต่ำที่สุดในตอนนี้ Whisper คืออะไร: ไม่ใช่แค่ "เครื่องมือแปลงเสียงเป็นข้อความอีกตัวหนึ่ง" ความแตกต่างที่สำคัญที่สุดระหว่าง Whisper กับการพิมพ์ด้วยเสียงของ Google หรือการบอกจดของ iOS คือ "รันแบบออฟไลน์ได้" และ "ดาวน์โหลดตัวโมเดลได้" OpenAI อธิบายไว้ใน "Whisper ฝึกด้วยข้อมูลกำกับแบบหลายภาษาและหลายงาน 680,000 ชั่วโมง" (แหล่งที่มา: บล็อกทางการของ OpenAI, กันยายน 2022) ว่าโมเดลชุดนี้ใช้สถาปัตยกรรม encoder-decoder Transformer โดยตัดเสียงเป็นช่วงละ 30 วินาที แปลงเป็นสเปกโตรแกรม log-Mel แล้วป้อนเข้าโมเดล เพื่อส่งออกข้อความในครั้งเดียว ทั้งค่าน้ำหนักและโค้ดอนุมานเปิดเผยทั้งหมดใน คลัง GitHub ภายใต้สัญญาอนุญาต MIT หมายความว่าการใช้เชิงพาณิชย์ การดัดแปลง และการเผยแพร่ต่อไม่มีข้อจำกัด จุดนี้เองที่กำหนดคุณค่าเชิงปฏิบัติของมัน: ไฟล์เสียงที่รั่วไหลออกไปไม่ได้ เช่น เสียงสัมภาษณ์ของสำนักงานกฎหมาย บันทึกการปรึกษาทางการแพทย์ หรือการประชุมภายในองค์กร สามารถประมวลผลบนเครื่องตัวเองได้ทั้งหมด โดยไม่ผ่านเซิร์ฟเวอร์ของบุคคลที่สามใดๆ องค์ประกอบของข้อมูลฝึกก็อธิบายจุดแข็งและจุดอ่อนของมันเช่นกัน "ในข้อมูลฝึก 65% เป็นเสียงภาษาอังกฤษคู่กับข้อความภาษาอังกฤษ 18% เป็นเสียงที่ไม่ใช่ภาษาอังกฤษคู่กับข้อความภาษาอังกฤษ และ 17% เป็นเสียงที่ไม่ใช่ภาษาอังกฤษคู่กับข้อความภาษาเดียวกัน" (แหล่งที่มา: เปเปอร์ Whisper ของ OpenAI, ปี 2022) สัดส่วนภาษาอังกฤษสูงอย่างท่วมท้น คุณภาพการรู้จำภาษาอังกฤษจึงเหนือกว่าภาษาอื่นอย่างชัดเจน ส่วนภาษาจีนอยู่ในกลุ่มปริมาณข้อมูลระดับสอง ในทางปฏิบัติทำงานได้เสถียร แต่ยังผิดพลาดในกรณีที่มีคำเฉพาะหรือสำเนียงหนัก เลือกขนาดโมเดลทั้งห้าแบบอย่างไร Whisper มีโมเดลให้เลือก 6 ขนาด ความต้องการหน่วยความจำและความเร็วต่างกันมากกว่า
FAQ
Whisper คืออะไร: ไม่ใช่แค่ "เครื่องมือแปลงเสียงเป็นข้อความอีกตัวหนึ่ง"
ความแตกต่างที่สำคัญที่สุดระหว่าง Whisper กับการพิมพ์ด้วยเสียงของ Google หรือการบอกจดของ iOS คือ "รันแบบออฟไลน์ได้" และ "ดาวน์โหลดตัวโมเดลได้" OpenAI อธิบายไว้ใน "Whisper ฝึกด้วยข้อมูลกำกับแบบหลายภาษาและหลายงาน 680,000 ชั่วโมง" (แหล่งที่มา: บล็อกทางการของ OpenAI, กันยายน 2022) ว่าโมเดลชุดนี้ใช้สถาปัตยกรรม encoder-decoder Transformer โดยตัดเสียงเป็นช่วงละ 30 วินาที แปลงเป็นสเปกโตรแกรม log-Mel แล้วป้อนเข้าโมเดล เพื่อส่งออกข้อความในครั้งเดียว ทั้งค่าน้ำหนักและโค้ดอนุมานเปิดเผยทั้งหมดใน คลัง GitHub ภ
เลือกขนาดโมเดลทั้งห้าแบบอย่างไร
Whisper มีโมเดลให้เลือก 6 ขนาด ความต้องการหน่วยความจำและความเร็วต่างกันมากกว่า 10 เท่า เลือกผิดจะทำให้เครื่องค้างไปเลย สเปกที่ประกาศอย่างเป็นทางการมีดังนี้: tiny : 39 ล้านพารามิเตอร์ ต้องการ VRAM ราว 1GB ความเร็วประมาณ 10 เท่าของ large เหมาะกับซับไตเติลเรียลไทม์และคำสั่งเสียงที่ทนความผิดพลาดได้สูง base : 74 ล้านพารามิเตอร์ ต้องการ VRAM ราว 1GB ความเร็วประมาณ 7 เท่า small : 244 ล้านพารามิเตอร์ ต้องการ VRAM ราว 2GB ความเร็วประมาณ 4 เท่า เป็นขีดต่ำสุดที่ใช้งานได้จริงสำหรับถอดเทปภาษาจีน medium : 769
อุปสรรคจริงของการติดตั้งทั้งสามวิธี
วิธีที่หนึ่ง: แพ็กเกจ Python ทางการ (อุปสรรคทางเทคนิคสูงสุด ควบคุมได้ครบที่สุด) ต้องติดตั้ง Python 3.8-3.11 และ ffmpeg ก่อน แล้วรัน pip install -U openai-whisper คำสั่งถอดความคือ whisper audio.mp3 --model large-v3 --language Chinese ข้อดีของเส้นทางนี้คือใช้พารามิเตอร์ได้ทุกตัว (temperature, beam size, ข้อความชี้นำเริ่มต้น) และเขียนเป็นสคริปต์ประมวลผลแบบชุดทั้งโฟลเดอร์ได้ด้วย ข้อเสียคือการติดตั้งครั้งแรกมีโอกาสติดปัญหาสูง โดยจุดที่ล้มเหลวบ่อยที่สุดคือเวอร์ชัน PyTorch กับ CUDA ไม่ตรงกัน วิธีที่สอง
คู่มือที่เกี่ยวข้อง
ตรวจสอบและยืนยันโดย FeiYueh · อัปเดตล่าสุด 2026-09-02. Independently maintained — not AI-generated boilerplate.
← Back to Blog