Whisper chuyển giọng nói thành văn bản — Giải pháp tạo bản ghi miễn phí từ mô hình mã nguồn mở của OpenAI

Whisper là mô hình nhận dạng giọng nói được OpenAI phát hành mã nguồn mở theo giấy phép MIT vào tháng 9 năm 2022, bất kỳ ai cũng có thể chạy miễn phí trên máy t

Whisper là mô hình nhận dạng giọng nói được OpenAI phát hành mã nguồn mở theo giấy phép MIT vào tháng 9 năm 2022, bất kỳ ai cũng có thể chạy miễn phí trên máy tính của mình, không cần trả phí, không cần tải tệp âm thanh lên đám mây. Nó được huấn luyện bằng 680.000 giờ âm thanh đa ngôn ngữ, hỗ trợ nhận dạng và dịch 99 ngôn ngữ, độ chính xác nhận dạng tiếng Trung (bao gồm phồn thể) có thể đạt trên 95% với bản thu sạch. Đối với cá nhân và nhóm nhỏ cần xử lý lượng lớn bản ghi âm cuộc họp, phỏng vấn, video khóa học, đây là giải pháp tạo bản ghi có chi phí thấp nhất hiện nay. Whisper là gì: không chỉ là "một công cụ chuyển giọng nói thành văn bản khác" Khác biệt lớn nhất giữa Whisper với nhập liệu bằng giọng nói của Google hay đọc chính tả trên iOS nằm ở "chạy được ngoại tuyến" và "tải được mô hình về". OpenAI đã giải thích trong "Whisper được huấn luyện bằng 680.000 giờ dữ liệu giám sát đa ngôn ngữ và đa nhiệm vụ" (nguồn: blog chính thức của OpenAI, tháng 9 năm 2022) rằng mô hình này dùng kiến trúc encoder-decoder Transformer, cắt âm thanh thành các đoạn 30 giây, chuyển thành phổ đồ log-Mel rồi đưa vào mô hình, xuất ra văn bản một lần. Trọng số và mã suy luận của nó đều được công khai toàn bộ trên kho lưu trữ GitHub , theo giấy phép MIT, nghĩa là sử dụng thương mại, chỉnh sửa, phân phối lại đều không bị hạn chế. Điểm này quyết định giá trị thực tế của nó: bản ghi âm phỏng vấn của văn phòng luật sư, hồ sơ tư vấn y tế, cuộc họp nội bộ doanh nghiệp — những tệp âm thanh không được rò rỉ ra ngoài — có thể được xử lý hoàn toàn trên máy cục bộ, không qua bất kỳ máy chủ bên thứ ba nào. Thành phần dữ liệu huấn luyện cũng lý giải điểm mạnh và điểm yếu của nó. "Trong dữ liệu huấn luyện, 65% là âm thanh tiếng Anh kèm văn bản tiếng Anh, 18% là âm thanh không phải tiếng Anh kèm văn bản tiếng Anh, 17% là âm thanh không phải tiếng Anh kèm văn bản cùng ngôn ngữ" (nguồn: bài báo Whisper của OpenAI, năm 2022) . Tỷ lệ tiếng Anh áp đảo, vì vậy chất lượng nhận dạng tiếng Anh rõ ràng vượt trội

相關工具書

Đã được xem xét và xác minh bởi FeiYueh · Lần xác minh gần nhất 2026-09-02. Independently maintained — not AI-generated boilerplate.

← Back to Blog