Whisper Speech-to-Text — Solusi Transkrip Gratis dari Model Open Source OpenAI
Whisper adalah model pengenalan suara yang dirilis OpenAI sebagai open source dengan lisensi MIT pada September 2022. Siapa pun bisa menjalankannya secara grati
Whisper adalah model pengenalan suara yang dirilis OpenAI sebagai open source dengan lisensi MIT pada September 2022. Siapa pun bisa menjalankannya secara gratis di komputer sendiri, tanpa biaya dan tanpa perlu mengunggah file audio ke cloud. Model ini dilatih dengan 680.000 jam audio multibahasa, mendukung pengenalan dan penerjemahan 99 bahasa, dan akurasi pengenalan bahasa Mandarin (termasuk aksara tradisional) bisa mencapai di atas 95% pada rekaman yang bersih. Bagi individu dan tim kecil yang harus menangani banyak rekaman rapat, wawancara, atau video kursus, ini adalah solusi transkrip dengan biaya terendah saat ini. Apa Itu Whisper: Bukan Sekadar "Alat Speech-to-Text Lainnya" Perbedaan terbesar Whisper dibanding input suara Google atau dikte iOS terletak pada "bisa dijalankan offline" dan "model bisa diunduh". OpenAI menjelaskan dalam "Whisper dilatih dengan 680.000 jam data supervisi multibahasa dan multitugas" (sumber: blog resmi OpenAI, September 2022) bahwa model ini memakai arsitektur Transformer encoder-decoder, memotong audio menjadi segmen 30 detik, mengubahnya menjadi spektrogram log-Mel, lalu memasukkannya ke model dan menghasilkan teks sekaligus. Bobot model dan kode inferensinya sepenuhnya terbuka di repositori GitHub dengan lisensi MIT, artinya penggunaan komersial, modifikasi, dan redistribusi tidak dibatasi. Hal ini menentukan nilai praktisnya: rekaman wawancara kantor hukum, catatan konsultasi medis, rapat internal perusahaan — file audio yang tidak boleh bocor ke luar — bisa diproses sepenuhnya di perangkat lokal tanpa melewati server pihak ketiga mana pun. Komposisi data pelatihan juga menjelaskan kelebihan dan kelemahannya. "Dalam data pelatihan, 65% adalah audio bahasa Inggris dengan teks bahasa Inggris, 18% audio non-Inggris dengan teks bahasa Inggris, dan 17% audio non-Inggris dengan teks dalam bahasa yang sama" (sumber: makalah Whisper OpenAI, 2022) . Porsi bahasa Inggris jauh mendominasi, sehingga kualitas pengenalan bahasa Inggris jela
Panduan Terkait
Ditinjau dan diverifikasi oleh FeiYueh · Terakhir diverifikasi 2026-09-02. Independently maintained — not AI-generated boilerplate.
← Back to Blog