FLUX 模型完整指南 — 開源 AI 圖像生成的新標竿
FLUX.1 由 Stable Diffusion 原始團隊出走成立的 Black Forest Labs 於 2024 年 8 月發布,以 120 億參數的 rectified flow transformer 架構,在人手結構、文字排版與提示詞遵循度三項傳統開源模型的弱點上取得可用等級的表現。它同時提供三種授權層級
FLUX.1 由 Stable Diffusion 原始團隊出走成立的 Black Forest Labs 於 2024 年 8 月發布,以 120 億參數的 rectified flow transformer 架構,在人手結構、文字排版與提示詞遵循度三項傳統開源模型的弱點上取得可用等級的表現。它同時提供三種授權層級——完全開源的 schnell、非商用權重的 dev、僅 API 的 pro——讓使用者能在本機隱私、生成品質與商用授權之間自行取捨。這種分層策略,而非單一模型的絕對品質,才是 FLUX 生態能在 18 個月內累積大量衍生模型與工作流的關鍵。 FLUX 的技術架構與前代差異 FLUX.1 採用 rectified flow transformer,與 Stable Diffusion 系列使用的 latent diffusion 走的是不同數學路徑。傳統擴散模型從雜訊逐步去噪,需要 30 至 50 個採樣步驟;rectified flow 則將雜訊到影像的路徑訓練成接近直線,使少步驟採樣的品質衰減大幅降低。這是 FLUX.1 schnell 能在 1 至 4 步內產出可用影像的技術基礎,而同等步數下的 SD 1.5 或 SDXL 通常只能得到結構崩壞的輪廓。 參數規模是另一項分水嶺。 「FLUX.1 為 120 億參數的 rectified flow transformer」(來源:Black Forest Labs 官方發布公告,2024 年 8 月) ,相較 SDXL 的約 26 億參數(base UNet)高出約 4.6 倍。參數量直接反映在提示詞語意的解析能力上:多主體場景中「左邊的人拿著紅色雨傘、右邊的人穿藍色外套」這類綁定關係,SDXL 經常錯置屬性,FLUX 的錯置率明顯較低。 文字編碼器的雙軌設計也值得注意。FLUX 同時使用 CLIP 與 T5-XXL 兩組編碼器,T5 負責長句與複雜語法的語意理解,CLIP 負責視覺概念對齊。這解釋了為何 FLUX 對自然語言長提示詞(80 字以上完整句子)的反應優於關鍵字堆疊,與 SD 時代「tag 式提示詞」的操作習慣正好相反。 三種版本的實際取捨 選錯版本是初學者最常見的成本浪費,因為三者的授權與硬體需求差距極大。 FLUX.1 schnell schnell 採 Apache 2.0 授權,是三者中唯一可直接商用且可自由再散布權重的版本。 「FLUX.1 schnell 以 Apache 2.0 授權釋出,經 latent adversarial diffusion distillation 訓練,支援 1 至 4 步生成」(來源:Hugging Face 官方模型卡) 。它由 dev 版本蒸餾而來,代價是細節豐富度與風格多樣性下降,且對 CFG 調整幾乎沒有反應。適合場景:需大量產出縮圖、需商用授權、或硬體受限。 FLUX.1 dev dev 是本機部署的主流選擇,品質接近 pro 但授權限制為非商業使用。權重公開可下載,社群的 LoRA、ControlNet 與 IP-Adapter 幾乎都以 dev 為基底訓練。硬體門檻是真實障礙:FP16 完整權重約 24 GB,實務上需 24 GB VRAM 顯卡(RTX 3090/4090)才能舒適運行;使用 GGUF Q4 量化版可壓到約 7 GB,在 12 GB 顯卡上運行,代價是細節略降與偶發的手部瑕疵回升。 FLUX.1 pro pro 僅透過 API 提供,權重不公開,品質為三者最高且授權允許商用。適合不想維護 GPU、只需穩定輸出的商業專案。缺點是提示詞與生成內容都會經過第三方伺服器,涉及客戶資料或未公開產品設計時需先確認合規性。 本機部署的實際門檻 ComfyUI 是目前執行 FLUX 最成熟的介面,因為它的節點式架構能明確拆分雙文字編碼器與 VAE 的載入流程。安裝時需分別下載四個檔案:模型主體( flux1-dev.safetensors )、CLIP-L 編碼器、T5-XXL 編碼器、以及 VAE( ae.safetensors ),總容量約 30 GB。缺任一項都會導致節點報錯,這是新手最常卡關的環節。 VRAM 不足時,量化是唯一實際解法。GGUF 格式提供 Q8、Q6_K、Q5_K_M、Q4_K_S 等多種等級,量化越深佔用越低但細節損失越明顯。經驗上的分界點:Q8 與 FP16 肉眼幾乎無差異;Q4 開始在細小文字與臉部特徵出現可辨識的劣化。8 GB VRAM 顯卡建議搭配 Q4 加上 --lowvram 參數,並接受單張 1024×1024 影像約 60 至 120 秒的生成時間。 Apple Silicon 的支援已可用但非最佳。M 系列晶片透過 MPS backend 可執
相關工具書
由 FeiYueh 親自審稿驗證 · 最後更新於 2026-08-31. Independently maintained — not AI-generated boilerplate.
← Back to Blog