ComfyUI 節點式 AI 繪圖 — 免費打造自己的 Stable Diffusion 工作流

ComfyUI 是目前唯一能把 Stable Diffusion 完整推論流程拆成可視化節點、並將整份工作流以 JSON 儲存與重播的開源介面。這意味著任何一張圖的生成過程都可完整重現:換模型、加 ControlNet、串接影片生成,都只是改接線,而非重寫程式碼。對想在本機免費建立可控 AI 繪圖流程的人來說,這是與

ComfyUI 是目前唯一能把 Stable Diffusion 完整推論流程拆成可視化節點、並將整份工作流以 JSON 儲存與重播的開源介面。這意味著任何一張圖的生成過程都可完整重現:換模型、加 ControlNet、串接影片生成,都只是改接線,而非重寫程式碼。對想在本機免費建立可控 AI 繪圖流程的人來說,這是與 Automatic1111 之類表單式介面最根本的差異。 ComfyUI 與表單式介面的結構差異 核心差別在於「流程是否為第一級物件」。Automatic1111 WebUI 把 txt2img 流程寫死在後端,使用者只能填欄位;ComfyUI 則把 Load Checkpoint、CLIP Text Encode、KSampler、VAE Decode 各自變成獨立節點,由使用者自行連線決定資料流向。 這帶來三個實務後果: 可重現性 :每張 PNG 的 metadata 內嵌完整工作流 JSON,把圖片拖回畫布即還原全部參數,包含種子、取樣器、LoRA 權重。 記憶體效率 :ComfyUI 只執行被連到輸出端的節點,改動一個提示詞時,未變動的上游節點結果直接沿用快取,不必重跑整條流程。 可組合性 :ControlNet、IP-Adapter、AnimateDiff、影片模型都以節點形式接入,不需要等待介面作者做專屬 UI 支援。 ComfyUI 由 comfyanonymous 於 2023 年 1 月開源,採 GPL-3.0 授權。 「GitHub 星數超過 8.5 萬、fork 逾 9,000(2025 年統計)」(來源:GitHub comfyanonymous/ComfyUI) ,是同類 AI 繪圖介面中社群規模最大的專案之一。 安裝與硬體門檻的實際數字 ComfyUI 在 8GB VRAM 的消費級顯卡上即可跑 SDXL,這是它與其他介面拉開距離的關鍵。官方支援 NVIDIA CUDA、AMD ROCm、Intel XPU 與 Apple Silicon MPS 四種後端,並內建低顯存模式,在顯存不足時自動把模型分段搬進搬出。 目前有三條安裝路徑: 官方桌面版 :Windows/macOS 圖形安裝檔,附帶 Python 環境與 ComfyUI Manager,適合不碰指令列的人。 Portable 壓縮包 :Windows 專用,解壓即用,內含 embedded Python,不污染系統環境。 Git clone + pip :自行建立 venv,安裝對應 CUDA 版本的 PyTorch,彈性最高,也最容易因版本錯配而失敗。 硬體現實面:Stable Diffusion 1.5 在 4GB VRAM 可運作;SDXL 建議 8GB 以上;Flux.1-dev 的完整 fp16 權重約 23.8GB,需要量化為 fp8 或 GGUF 才能塞進 12GB 顯卡。 「SDXL 1.0 具 35 億參數基礎模型加 66 億參數 refiner,於 2023 年 7 月發布」(來源:Stability AI) ,這組數字直接決定你需要多少顯存。 Apple Silicon 使用者需注意:MPS 後端可用但速度明顯落後,M2 Max 產生一張 1024×1024 SDXL 圖約需 40–60 秒,同期 RTX 4070 約 8–12 秒。 第一個工作流:拆解預設的七個節點 ComfyUI 啟動後的預設工作流只有七個節點,理解它們等於理解整個 Stable Diffusion 推論管線。 節點的職責分工 Load Checkpoint :載入模型檔,輸出三條線——MODEL(UNet)、CLIP(文字編碼器)、VAE(影像編解碼器)。 CLIP Text Encode (兩個):分別接正向與負向提示詞,把文字轉成 conditioning 張量。 Empty Latent Image :產生指定尺寸的空白潛在空間張量,決定輸出解析度與批次數。 KSampler :實際去噪迴圈所在,控制 steps、CFG scale、sampler、scheduler、seed 五個關鍵參數。 VAE Decode :把潛在空間張量還原成 RGB 影像。 Save Image :寫檔並把工作流 JSON 嵌入 PNG metadata。 參數調整的優先順序 影響畫面品質的參數存在明確的邊際效益差異。steps 從 20 提到 50,多數取樣器的畫質增益在 30 步後趨近於零,但生成時間線性增加 150%。CFG scale 落在 6–8 之間通常最穩定,超過 12 會出現顏色過飽和與細節崩壞。 實務建議的調整順序是:先固定 seed 找到構圖,再調提示詞,最後才動 steps 與 CFG。這個順序能讓每次變動的因果關係可辨識,

相關工具書

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-08-31. Independently maintained — not AI-generated boilerplate.

← Back to Blog