Ollama 本地跑 AI 模型 — 免費、離線、資料不外流
Ollama 讓一般筆電在完全離線的狀態下執行 Llama、Qwen、Gemma 等開源大型語言模型,所有對話資料留在本機硬碟,不經過任何雲端伺服器。對隱私敏感的工作(法律文件、病歷、未公開財報、公司內部程式碼)而言,這是目前技術門檻最低的解法:安裝到跑出第一個回應約 5 分鐘,成本為零。 Ollama 是什麼:把模型
Ollama 讓一般筆電在完全離線的狀態下執行 Llama、Qwen、Gemma 等開源大型語言模型,所有對話資料留在本機硬碟,不經過任何雲端伺服器。對隱私敏感的工作(法律文件、病歷、未公開財報、公司內部程式碼)而言,這是目前技術門檻最低的解法:安裝到跑出第一個回應約 5 分鐘,成本為零。 Ollama 是什麼:把模型下載到自己電腦上跑 Ollama 是一套開源的本地 LLM 執行工具,把模型權重下載、量化格式解析、GPU/CPU 推論排程、REST API 服務全部包成一個指令。使用者不需要理解 CUDA 版本、PyTorch 相依性或量化參數,輸入 ollama run llama3.2 就會自動下載模型並進入對話介面。 它的底層是 llama.cpp ,一個以 C/C++ 寫成的推論引擎,支援 GGUF 量化格式,讓原本需要數十 GB 顯示記憶體的模型壓縮到能在消費級硬體上執行。Ollama 在其上加了模型管理(類似 Docker 的 pull/run/list 概念)、Modelfile 自訂設定,以及相容 OpenAI 格式的本機 API 端點。 採用規模已經不算小眾。 「Ollama GitHub 專案累計超過 15 萬顆星標」(來源:GitHub / ollama 官方 repo) ,在開源開發者工具中屬於前段。模型庫方面, 「Ollama 官方模型庫收錄超過 200 個模型系列」(來源:Ollama 官方 Library) ,涵蓋 Meta Llama、阿里 Qwen、Google Gemma、Mistral、DeepSeek 等主流開源家族,以及專攻程式碼、視覺、嵌入向量的專用模型。 資料不外流的實際意義 本地執行的隱私保證來自架構本身,不是廠商承諾。模型權重存在本機磁碟,推論在本機 CPU/GPU 完成,對話內容不會產生任何對外網路封包。切斷網路後 Ollama 仍可正常運作,這一點可以自己驗證:關閉 Wi-Fi 再執行 ollama run ,模型照常回答。 這與雲端 AI 服務的差別在責任歸屬。使用 ChatGPT、Claude 或 Gemini 時,輸入內容會傳送到服務商伺服器處理,是否用於訓練、保存多久、由誰能存取,取決於服務條款與企業方案設定。多數服務商的企業方案已承諾不用客戶資料訓練,但資料仍然離開了組織邊界——對受 GDPR、HIPAA 或金融監理規範的單位來說,這個「離開」本身就是需要評估與申報的動作。 企業對此的顧慮有具體數據支撐。 「IBM《資料外洩成本報告 2024》指出全球平均單次資料外洩成本為 488 萬美元」(來源:IBM Security) ,其中牽涉第三方或供應鏈的外洩,平均修復時間又比內部事件更長。本地模型把 AI 這一環從第三方風險清單上移除。 適合用本地模型的場景 合約與法律文件摘要 :內容含當事人姓名、金額、營業秘密,不宜上傳外部服務。 醫療與心理諮商紀錄整理 :多數司法管轄區對病歷跨境傳輸有明確限制。 企業內部程式碼分析 :私有 repo 的邏輯與金鑰片段。 離線環境 :飛機、船舶、工廠內網、軍警與政府封閉網段。 高頻批次處理 :一次跑數萬筆分類或翻譯,用雲端 API 計費會累積成可觀支出,本地只付電費。 硬體門檻與模型挑選 能不能跑得動,取決於記憶體容量而非 CPU 速度。模型載入時整份權重要放進記憶體(有獨立顯卡則放進 VRAM),容量不足會退回硬碟交換,速度掉到無法使用的程度。經驗值是:模型參數量(十億為單位)乘以約 0.6-0.7 GB,即為 4-bit 量化後的實際佔用。 8 GB 記憶體 :可跑 3B 以下模型(Llama 3.2 3B、Qwen 3 4B、Gemma 3 4B),適合摘要、改寫、簡易問答。 16 GB 記憶體 :可跑 7B-8B 模型(Llama 3.1 8B、Qwen 3 8B、Mistral 7B),推理與程式碼能力明顯提升,是實用性的分水嶺。 32 GB 記憶體 :可跑 14B-32B 模型,回答品質接近上一代商用雲端模型。 64 GB 以上 :可跑 70B 級模型,但生成速度會降到每秒個位數 token。 Apple Silicon 的 Mac 在這件事上有結構性優勢:統一記憶體架構讓 CPU 與 GPU 共用同一塊記憶體,一台 32 GB 的 MacBook Pro 實際可用於模型的記憶體遠高於同價位配 8 GB VRAM 顯卡的 Windows 筆電。 「Apple M3 Max 支援最高 128 GB 統一記憶體」(來源:Apple Newsroom, 2023 年 10 月) ,這個規格讓單機執行大型模型成為可能。 速度的實際數字 生成速度以「每秒 token 數」衡量,一般中文閱讀速度約每秒 5-8 個 token,低
相關工具書
由 FeiYueh 親自審稿驗證 · 最後更新於 2026-09-01. Independently maintained — not AI-generated boilerplate.
← Back to Blog