Whisper 語音轉文字 — OpenAI 開源模型的免費逐字稿方案

Whisper 是 OpenAI 於 2022 年 9 月以 MIT 授權開源的語音辨識模型,任何人都能在自己的電腦上免費執行,不需付費、不需上傳音檔到雲端。它用 68 萬小時多語言音訊訓練,支援 99 種語言的辨識與翻譯,中文(含繁體)辨識準確率在乾淨錄音下可達 95% 以上。對於需要處理大量會議錄音、訪談、課程影片

Whisper 是 OpenAI 於 2022 年 9 月以 MIT 授權開源的語音辨識模型,任何人都能在自己的電腦上免費執行,不需付費、不需上傳音檔到雲端。它用 68 萬小時多語言音訊訓練,支援 99 種語言的辨識與翻譯,中文(含繁體)辨識準確率在乾淨錄音下可達 95% 以上。對於需要處理大量會議錄音、訪談、課程影片的個人與小團隊,這是目前成本最低的逐字稿方案。 Whisper 是什麼:不只是「另一個語音轉文字工具」 Whisper 與 Google 語音輸入、iOS 聽寫最大的差別在於「離線可執行」與「模型可下載」。OpenAI 在 「Whisper 以 68 萬小時多語言與多任務監督資料訓練」(來源:OpenAI 官方部落格,2022 年 9 月) 中說明,這套模型採 encoder-decoder Transformer 架構,把音訊切成 30 秒片段轉成 log-Mel 頻譜圖後輸入模型,一次輸出文字。 它的權重與推論程式碼全部公開在 GitHub 儲存庫 ,採 MIT 授權,代表商業使用、修改、再散布都不受限制。這一點決定了它的實際價值:律師事務所的訪談錄音、醫療諮詢紀錄、企業內部會議這類不能外流的音檔,可以完全在本機處理,不經過任何第三方伺服器。 訓練資料的組成也解釋了它的強項與弱點。 「訓練資料中 65% 為英語音訊配英語文字、18% 為非英語音訊配英語文字、17% 為非英語音訊配同語言文字」(來源:OpenAI Whisper 論文,2022 年) 。英語佔比壓倒性偏高,因此英語辨識品質明顯優於其他語言;中文屬於資料量第二梯隊,實務上表現穩定但在專有名詞與口音重的場合仍會出錯。 五種模型尺寸怎麼選 Whisper 提供六個模型尺寸,記憶體需求與速度差距達 10 倍以上,選錯會直接卡死你的電腦。官方公布的規格如下: tiny :3900 萬參數,約需 1GB VRAM,速度約為 large 的 10 倍。適合即時字幕、語音指令這類容錯高的場景。 base :7400 萬參數,約需 1GB VRAM,速度約 7 倍。 small :2.44 億參數,約需 2GB VRAM,速度約 4 倍。中文逐字稿的實用下限。 medium :7.69 億參數,約需 5GB VRAM,速度約 2 倍。品質與速度的平衡點。 large-v3 :15.5 億參數,約需 10GB VRAM。中文辨識建議直接用這個。 turbo :8.09 億參數,約需 6GB VRAM,速度約 8 倍,品質接近 large-v2。 實際選擇邏輯很直接:如果你的電腦有獨立顯卡且 VRAM 在 10GB 以上,直接用 large-v3 。如果是 Apple Silicon 的 Mac(M1 以上,16GB 統一記憶體), medium 或 turbo 是甜蜜點。純 CPU 執行的話, small 以上會慢到不切實際——一小時音檔在 CPU 上跑 large 可能需要 3 到 5 小時。 turbo 是 2024 年 9 月釋出的版本,把 large-v3 的 decoder 層數從 32 層砍到 4 層,速度大幅提升而品質衰減有限。但要注意 turbo 不支援翻譯任務(translate),只能做原語言轉錄。 三種安裝方式的實際門檻 方式一:官方 Python 套件(技術門檻最高,控制最完整) 需要先裝 Python 3.8-3.11 與 ffmpeg,然後執行 pip install -U openai-whisper 。轉錄指令是 whisper audio.mp3 --model large-v3 --language Chinese 。這條路的優勢是能用所有參數(溫度、beam size、初始提示詞),也能寫成批次腳本處理整個資料夾。缺點是首次安裝踩坑機率高,PyTorch 與 CUDA 版本不匹配是最常見的失敗點。 方式二:whisper.cpp(速度最快,記憶體最省) 由開發者 Georgi Gerganov 用 C/C++ 重寫的推論引擎,不依賴 Python 與 PyTorch,在 Apple Silicon 上透過 Metal 加速。 whisper.cpp 專案 提供量化模型(Q5、Q8),把 large-v3 的記憶體佔用從約 3.1GB 壓到約 1.1GB,代價是準確率下降約 1-2 個百分點。M2 MacBook Air 用量化 large-v3 處理一小時中文錄音約需 15 到 25 分鐘。 方式三:圖形介面工具(零技術門檻) 不想碰終端機的話,MacWhisper(macOS)、Buzz(跨平台)、WhisperDesktop(Windows)都提供拖曳音檔就出逐字稿的介面,底層跑的是同一套模型。Buzz 是開源免費,Mac

FAQ

Whisper 是什麼:不只是「另一個語音轉文字工具」

Whisper 與 Google 語音輸入、iOS 聽寫最大的差別在於「離線可執行」與「模型可下載」。OpenAI 在 「Whisper 以 68 萬小時多語言與多任務監督資料訓練」(來源:OpenAI 官方部落格,2022 年 9 月) 中說明,這套模型採 encoder-decoder Transformer 架構,把音訊切成 30 秒片段轉成 log-Mel 頻譜圖後輸入模型,一次輸出文字。 它的權重與推論程式碼全部公開在 GitHub 儲存庫 ,採 MIT 授權,代表商業使用、修改、再散布都不受限制。這一點決定了它的實際價值:律師事務所的訪談錄音、醫療諮詢紀錄、企業內部會議這類不能外流的音檔,可以完全在本機處理,不經過任何第三方伺服器。 訓練資料的組成也解釋了它的強項與弱點。 「訓練資料中 65% 為英語音訊配英語文字、18% 為非英語音訊配英語文字、17% 為非英語音訊配同語言文字」(來源:OpenAI Whisper 論文,2022 年) 。英語佔比壓倒性偏高,因此英語辨識品質明顯優於其他語言;中文屬於資料量第二梯隊,實務上表現穩定但在專有名詞與口音重的場合仍會出錯。

五種模型尺寸怎麼選

Whisper 提供六個模型尺寸,記憶體需求與速度差距達 10 倍以上,選錯會直接卡死你的電腦。官方公布的規格如下: tiny :3900 萬參數,約需 1GB VRAM,速度約為 large 的 10 倍。適合即時字幕、語音指令這類容錯高的場景。 base :7400 萬參數,約需 1GB VRAM,速度約 7 倍。 small :2.44 億參數,約需 2GB VRAM,速度約 4 倍。中文逐字稿的實用下限。 medium :7.69 億參數,約需 5GB VRAM,速度約 2 倍。品質與速度的平衡點。 large-v3 :15.5 億參數,約需 10GB VRAM。中文辨識建議直接用這個。 turbo :8.09 億參數,約需 6GB VRAM,速度約 8 倍,品質接近 large-v2。 實際選擇邏輯很直接:如果你的電腦有獨立顯卡且 VRAM 在 10GB 以上,直接用 large-v3 。如果是 Apple Silicon 的 Mac(M1 以上,16GB 統一記憶體), medium 或 turbo 是甜蜜點。純 CPU 執行的話, small 以上會慢到不切實際——一小時

下一步:用 20 分鐘驗證它是否適合你

先不要研究安裝。挑一段 5 分鐘、最接近你日常需求的真實錄音(不是乾淨的朗讀,要有背景音與正常語速),到 Hugging Face 上的 Whisper 線上 Demo 直接上傳測試。看輸出的錯字率是否在你能接受的校對範圍內。 如果結果可用,再依需求量決定路線:每月 10 小時以下註冊 OpenAI API 直接呼叫;量大或需保密,安裝 faster-whisper 搭配 large-v3 模型,第一次執行前先確認顯卡 VRAM 或 Mac 統一記憶體是否達 10GB。若結果錯字率過高,問題通常出在錄音品質而非模型——先改善收音(外接麥克風、降低環境噪音)再回頭測一次,這比換模型有效得多。

相關工具書

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-09-02. Independently maintained — not AI-generated boilerplate.

← Back to Blog