ComfyUI 教學:從本機安裝、Z-Image-Turbo 出圖到 Wan 2.2 生成影片
從官方 Comfy Desktop 安裝開始,理解模型資料夾與核心節點,再用 Z-Image-Turbo 出圖、Wan 2.2 生成影片。
ComfyUI 是一套用「節點連線」控制 AI 圖片、影片與音訊生成流程的開源工具。一般生成網站只讓你輸入 Prompt 後按下按鈕,ComfyUI 則把載入模型、理解文字、生成畫面與儲存檔案拆成一個個方塊,讓你看見並修改整條流程。
這種自由度很高,初次打開時也容易被滿畫面的節點嚇到。其實新手不需要先學會自己搭工作流,也不必一口氣安裝十幾個外掛。最實際的順序是:先用官方 Desktop 版完成安裝,再載入官方模板,跑通一張圖片,最後才嘗試影片。
我的建議很明確:第一個圖片模型先用 Z-Image-Turbo,第一個影片模型先用 Wan 2.2 5B。MiniMax H3 的能力更完整,卻需要更大的模型與更多運算資源,不適合拿來當第一次成功測試。
ComfyUI 是什麼?為什麼要用節點?

ComfyUI 可以把一條生成流程看成資料流。每個節點負責一件事,連線決定資料往哪裡走。以最基本的文字生成圖片來說,流程大致如下:
載入模型 → 讀取 Prompt → 建立空白潛在影像 → 採樣生成 → 解碼成圖片 → 儲存檔案
Prompt 是交給模型的文字指令,用來描述主體、場景、動作、光線與風格。潛在影像(latent image)則是模型進行運算時使用的壓縮表示,還不是人眼能直接觀看的圖片。最後要經過 VAE Decode 節點,才能把它還原成一般圖片。
這種設計有三個實際好處:
- 可以看出每個參數如何影響結果,不必把所有控制項塞在同一個面板。
- 同一套工作流能替換模型、尺寸、Prompt 與輸入素材,方便反覆測試。
- 工作流可以存成 JSON 設定檔,也能寫進 ComfyUI 產生的圖片中,分享給別人後繼續修改。JSON 是保存節點、連線與參數的文字檔格式。
ComfyUI 官方入門文件說明,ComfyUI 生成的圖片會包含工作流中繼資料。只要圖片沒有被社群平台壓縮或重新轉檔,就能拖回畫布還原節點與參數。不過,正式專案仍建議另外匯出 JSON,避免圖片中繼資料遺失。
電腦跑得動 ComfyUI 嗎?先看三件事
1. 作業系統與安裝方式
ComfyUI 官方系統需求目前支援 Windows、Linux 與 Apple Silicon Mac。對新手來說,Windows 10 以上或 macOS 13 以上可以優先使用官方 Comfy Desktop。Linux 沒有官方預先建置的 Desktop 安裝檔,需要從原始碼安裝。
| 使用環境 | 建議方式 | 適合對象 |
|---|---|---|
| Windows 10 以上 | Comfy Desktop | 想快速安裝與自動管理環境的新手 |
| Apple Silicon Mac | Comfy Desktop | 使用 M1 以上 Mac,先從圖片生成開始 |
| Linux | 手動安裝 | 熟悉 Python、驅動與虛擬環境的使用者 |
| 不想本機安裝 | Comfy Cloud | 先測工作流,或本機硬體不足的人 |
網路上有許多第三方整合包,可能加入漢化、外掛與預設模型。它們確實能省下安裝時間,卻也可能使用舊版核心、修改依賴或夾帶來源不明的自訂節點。台灣新手若能正常連上官方網站與 Hugging Face,先用官方 Desktop 版會比較容易維護。
2. 顯存不是唯一條件,也沒有通用的 8GB 門檻
在 NVIDIA 或 AMD 顯示卡上,顯存(VRAM)是 GPU(顯示處理器)專門存放模型與運算資料的高速記憶體。模型、解析度與影片幀數越大,通常需要越多顯存。
但「8GB 就能跑 ComfyUI」只說對一半。ComfyUI 本身可以在 8GB 顯存上啟動,部分工作流也能透過 offloading 執行。Offloading 是把暫時不用的模型資料移到系統記憶體,等需要時再搬回 GPU。代價是搬運資料會拖慢速度,甚至讓同一個工作流從幾分鐘變成更久。
Apple Silicon Mac 使用統一記憶體,CPU(中央處理器)與 GPU 共用同一池記憶體,不能直接把 16GB 統一記憶體等同於 16GB 獨立顯存。實際能否執行,仍取決於模型格式、量化、解析度與 ComfyUI 支援狀態。
比較實際的判斷方式如下:
| 硬體狀況 | 建議起點 | 不建議一開始做的事 |
|---|---|---|
| 8GB 顯存 | 較小圖片模型、Wan 2.2 5B 低解析度測試 | 直接跑大型 H3 或高解析度長影片 |
| 12~16GB 顯存 | Z-Image-Turbo、較完整圖片工作流、Wan 2.2 5B | 一開始就追求 14B 影片模型 |
| 24GB 以上顯存 | 多數圖片工作流、Wan 2.2 5B 與部分大型量化模型 | 忽略磁碟、記憶體與生成時間成本 |
| Apple Silicon Mac | 官方 MPS 圖形運算加速、圖片工作流 | 把影片速度期待成高階 NVIDIA 桌機水準 |
| 沒有獨立 GPU | CPU 驗證安裝,或改用 Comfy Cloud | 把 CPU 當成日常圖片與影片生成方案 |
這張表是保守的入門建議,不是每個模型的保證規格。同樣是 8GB 顯存,模型精度、量化格式與畫面尺寸不同,結果可能完全不同。
3. 磁碟空間要把模型算進去
官方 Desktop 每個安裝環境建議至少保留約 4.85GB,但這只是程式與基本環境。AI 模型通常是數 GB 到數十 GB,圖片、影片與快取也會持續增加。
如果要完成本文的圖片與影片教學,建議另外準備至少 60GB 可用空間。想保留多個模型與輸出檔時,100GB 以上會比較實際。這不是 ComfyUI 的硬性門檻,而是避免安裝到一半才發現磁碟不足的工作空間建議。
ComfyUI 安裝教學:新手先用官方 Desktop
Windows 安裝
- 前往 ComfyUI 官方下載頁。
- 下載 Windows 版安裝程式並執行。
- 建立第一個 ComfyUI installation,也就是獨立的安裝環境,並選擇空間充足的 SSD 固態硬碟。
- 完成後啟動 ComfyUI,確認能看到節點畫布。
Windows 官方文件目前列出的基本條件是 Windows 10 以上、x64 或 ARM64,並建議使用獨立 NVIDIA 或 AMD GPU。沒有獨立 GPU 仍可啟動,但生成速度不適合作為日常工作流。
macOS 安裝
- 前往 ComfyUI 官方下載頁。
- 下載 macOS 版
.dmg,把 Comfy Desktop 拖進 Applications。 - 第一次開啟若出現安全提示,到「系統設定 → 隱私權與安全性」允許開啟。
- 建立 ComfyUI installation 後,先用官方圖片模板測試。
macOS 官方文件要求 macOS 13 以上與 M1 以上 Apple Silicon。Intel Mac 不在目前 Desktop 支援範圍內。
安裝後先做兩件事
第一件事是更新 ComfyUI。官方模板與核心節點更新很快,如果文件裡有模板、你的介面卻找不到,通常是版本尚未跟上。Desktop 使用穩定版更新節奏,新功能可能比最新開發版晚一些出現。
第二件事是確認 ComfyUI Manager。Manager 是管理自訂節點、模型與缺少元件的工具。Desktop 已經內建並預設啟用,不需要再執行舊教學裡的 git clone 指令。
自訂節點是能在本機執行程式碼的外掛,不只是外觀套件。第一次學習時先使用官方模板與核心節點。真的需要外掛,再從 Manager 的官方套件目錄查看來源、維護狀況與版本,不要看到工作流缺節點就一次安裝全部不明套件。
第一次出圖:先看懂六種核心節點
進入 ComfyUI 後,從 Template Library 選擇基本的 Text-to-Image 工作流。不同版本的模板名稱與模型可能不同,但核心流程大致包含以下角色:
| 節點角色 | 白話功能 |
|---|---|
| Load Checkpoint/Load Diffusion Model | 把圖片生成模型載入記憶體 |
| CLIP Text Encode(文字編碼) | 把正向或負向 Prompt 轉成模型能處理的訊號 |
| Empty Latent Image | 決定生成尺寸與批次,建立運算用空白畫布 |
| KSampler(採樣器) | 依模型、Prompt、seed 與步數逐步生成內容 |
| VAE Decode | 把潛在影像還原成一般像素圖片 |
| Save Image | 預覽並把結果寫進輸出資料夾 |
Seed 是生成時的隨機種子。同一個模型、Prompt 與設定搭配相同 seed,較容易重現相近結果。它不是品質分數,也不是越大越好。
KSampler 通常會接到兩個文字編碼節點。連到 positive 輸入的是正向 Prompt,描述你想看到的內容;連到 negative 的是負向 Prompt,描述希望避開的內容。判斷正負的依據是連線,不是節點在畫布上的上下位置。
跑通第一張圖
- 載入官方 Text-to-Image 模板。
- 按照缺少模型提示完成下載。Desktop 會自動把檔案放到對應資料夾。
- 在正向 Prompt 輸入一個簡單場景。
- 先保留模板預設尺寸與其他參數。
- 按下
Run,或使用Ctrl/Cmd + Enter。 - 在 Save Image 節點確認結果。
第一個 Prompt 不用寫得像小說。先測「主體、場景、動作、光線」四件事即可:
一隻戴著圓框墨鏡的橘貓坐在台南老屋咖啡店窗邊,
午後陽光穿過木窗,桌上有一杯冰咖啡,寫實攝影,自然色彩。
看到圖片就代表安裝、模型路徑、節點連線與基本推論都已正常。這時再調整尺寸、seed、採樣步數與 Prompt,會比在第一次執行前同時改十個參數更容易排錯。
模型應該放在哪個資料夾?

模型放錯位置,是新手最常遇到的問題之一。Comfy Desktop 可以從左上角選單進入 Help → Open folder → Open models folder,直接打開目前 installation 使用的模型資料夾。
| 模型類型 | 常見資料夾 | 用途 |
|---|---|---|
| 完整 checkpoint 模型檔 | ComfyUI/models/checkpoints/ |
把主要模型元件包在同一個檔案 |
| Diffusion model(擴散模型) | ComfyUI/models/diffusion_models/ |
負責逐步生成潛在影像或影片 |
| Text encoder(文字編碼器) | ComfyUI/models/text_encoders/ |
把 Prompt 轉成模型使用的表示 |
| VAE | ComfyUI/models/vae/ |
在潛在表示與一般圖片或影片間轉換 |
| LoRA(小型附加模型) | ComfyUI/models/loras/ |
用較小檔案追加角色、風格或能力 |
檔案放好後按 R 重新整理,或重啟 ComfyUI。若載入器的下拉選單仍是空的,先核對「檔名、資料夾、目前開啟的 installation」三件事,不要急著重裝整套程式。
Z-Image-Turbo 教學:第一個圖片模型怎麼選?

Z-Image-Turbo 是阿里巴巴通義實驗室推出的 6B 圖片模型。6B 代表大約 60 億個參數,可以粗略理解成模型規模的一種表示。ComfyUI 官方教學指出,它是只需 8 次函數評估的蒸餾版本,支援中英文 Prompt 與文字渲染,並可在 16GB 顯存的消費級設備執行。
它適合新手的原因不是「一定畫得最好」,而是官方已有原生模板,節點不必另外拼裝,而且中英文 Prompt 都能使用。模型頁標示為 Apache 2.0 授權,商業使用條件也比許多僅限非商用的模型清楚。
用官方模板完成 Z-Image-Turbo 出圖
- 更新 ComfyUI。
- 開啟 Template Library,搜尋
Z-Image-Turbo。 - 載入官方 Text-to-Image 工作流。
- Desktop 出現缺少模型提示後,讓它下載所需檔案。
- 確認模型、文字編碼器與 VAE 都已選中。
- 修改正向 Prompt,按
Run執行。
手動下載時,官方工作流使用三個主要檔案:
ComfyUI/models/
├── diffusion_models/
│ └── z_image_turbo_bf16.safetensors
├── text_encoders/
│ └── qwen_3_4b.safetensors
└── vae/
└── ae.safetensors
第一次測試請保留模板的採樣步數與模型設定,只修改 Prompt。先建立可成功重複的基準,再一次改一個變因。這樣若畫面突然變差,才知道是尺寸、步數、Prompt 還是模型造成。
Wan 2.2 教學:把第一張圖變成影片

圖片工作流跑通後,再進入影片。Wan 2.2 5B 同時支援文字生成影片與圖片生成影片,是目前較適合新手的本機起點。
ComfyUI 官方 Wan 2.2 文件指出,5B 版本搭配 ComfyUI 原生 offloading 可以適配 8GB 顯存。這不代表 8GB 會很快,也不代表所有 Wan 2.2 工作流都只需要 8GB。Wan 官方程式庫的 720p 參考推論配置仍以至少 24GB 顯存為例,兩者差異來自 ComfyUI 的記憶體搬移與重新封裝設定。
因此,8GB 顯存可以把它當成「有機會跑通」的起點,不該理解成「順暢製作高解析長片」的保證。
ComfyUI 官方影片示範 Wan 2.2 的 Day-0 原生工作流與操作方式。影片來源:ComfyUI 官方 YouTube。
用官方 Wan 2.2 5B 模板生成影片
- 開啟 Template Library,進入 Video 類別。
- 搜尋並載入
Wan2.2 5B Video Generation。 - 依提示下載 diffusion model、text encoder 與 VAE。
- 確認
Load Diffusion Model選到wan2.2_ti2v_5B_fp16.safetensors。 - 確認
Load CLIP與Load VAE已選到模板要求的檔案。 - 第一次先用模板的預設解析度與短幀數。
- 修改 Prompt,按
Run生成。
手動下載時,官方工作流的主要路徑如下:
ComfyUI/models/
├── diffusion_models/
│ └── wan2.2_ti2v_5B_fp16.safetensors
├── text_encoders/
│ └── umt5_xxl_fp8_e4m3fn_scaled.safetensors
└── vae/
└── wan2.2_vae.safetensors
圖生影片怎麼開啟?
Wan 2.2 5B 官方模板內含圖片輸入節點,但預設可能被停用。選取 Load Image 所在的圖生影片區塊,按 Ctrl/Cmd + B 切換啟用狀態,接著上傳圖片並在 Wan22ImageToVideoLatent 設定尺寸與幀數。
圖生影片比純文字生成更容易控制主體外觀。最實際的做法是先用圖片模型把構圖做對,再交給 Wan 2.2 產生動作。這能把「角色長什麼樣」和「角色怎麼動」拆成兩次可檢查的決策。
影片 Prompt 要多寫一層「運動」
圖片 Prompt 只描述畫面,影片 Prompt 還要交代動作、鏡頭與時間變化。不要只寫「一位女生站在海邊」,模型可能只讓頭髮微微晃動。
可以使用這個公式:
主體與場景 + 主體動作 + 鏡頭運動 + 光線與環境變化 + 不要出現的動作
例如:
一位穿米色風衣的女子站在傍晚海邊,她先望向遠方,再慢慢轉頭看向鏡頭。
海風吹動頭髮與衣角,鏡頭從中景緩慢向前推近,夕陽亮度逐漸降低。
單一連續鏡頭,不切鏡,不要突然移動,不要改變人物服裝。
第一次只做一個主體、一個動作與一種鏡頭運動。生成成功後再加入轉場、多人互動與複雜運鏡,會比一次要求完整短劇更容易得到可用片段。
MiniMax H3 要不要直接本機跑?
MiniMax H3 可以同時理解文字、圖片、影片與音訊,並生成帶有立體聲的影片。ComfyUI 官方 H3 教學提供文字生成影片、圖片生成影片與參考素材生成影片三種模板,要求 ComfyUI 0.30.0 以上。
它的能力比 Wan 2.2 5B 完整,模型也大得多。官方工作流除了 H3 擴散模型,還要載入以 Qwen3-VL-32B 為基礎的文字編碼器、影片 VAE、音訊 VAE、LoRA 與提示嵌入檔。這不只是「多下載一個檔案」,而是整套硬體、磁碟與等待時間成本都往上增加。
我的選擇是:新手先用 Wan 2.2 5B 理解影片工作流。只有在確定需要原生音訊、多份參考素材或角色聲音一致性時,再評估 H3。本機跑得動不等於跑得有效率,模型越大,offloading 帶來的等待也越明顯。
商業使用還有另一個差異。H3 公開權重可供本機執行,但 ComfyUI 文件說明,本機生成結果若用於商業用途,需要 MiniMax 商業授權;Comfy Cloud 生成則已包含商業權利。這和採 Apache 2.0 的 Z-Image-Turbo、Wan 2.2 並不相同。
ComfyUI 常見錯誤怎麼排查?
模型下拉選單是空的
先確認檔案是否放在該載入節點對應的資料夾,再按 R 重新整理。Desktop 有多個 installation 時,也要確認你打開的是目前這個環境的 models 資料夾。
載入工作流後出現紅色缺少節點
先更新 ComfyUI,再確認工作流是不是官方模板。第三方工作流缺少自訂節點時,開啟 Manager 查看節點包的來源與說明。不要直接降低安全設定或安裝來源不明的 Git 程式碼倉庫。
出現 CUDA out of memory(GPU 顯存不足)或直接中止
這代表 GPU 顯存不足。先降低解析度、批次、影片幀數或片長,再改用較小或量化的模型。不要同時開著其他占用 GPU 的程式。如果工作流仍需大量 offloading,改用雲端 GPU 往往比一直等待更實際。
生成速度比網路案例慢很多
社群案例可能使用不同 GPU、量化版本、解析度、幀數與加速節點。比較速度前,要把這些條件全部對齊。只看到「幾秒出圖」或「8GB 可跑」,無法推論自己的電腦會得到相同時間。
把圖片拖回 ComfyUI 沒有反應
圖片可能經過 LINE、Facebook、X 或其他平台重新壓縮,導致工作流中繼資料被移除。改用原始 PNG 或另外保存的 JSON 工作流。
使用別人的工作流,安全上要注意什麼?
工作流 JSON 主要記錄節點、連線與參數,本身不等於完整程式。但工作流引用的自訂節點會在你的電腦執行 Python 程式碼,也可能安裝新的依賴。
匯入第三方工作流前,至少檢查四件事:
- 優先使用 ComfyUI 官方 Template Library。
- 自訂節點優先從 Manager 官方套件目錄安裝,查看程式碼倉庫與近期維護狀態。
- 不要為了安裝未知節點,把 ComfyUI 對外網路公開或把安全層級調到最寬鬆。
- 重要專案先建立獨立安裝環境或快照備份,避免更新外掛後整個環境一起壞掉。
模型授權與素材權利也要分開檢查。模型允許商用,不代表你可以拿未授權的角色、演員臉孔、聲音、音樂或圖片去生成商業內容。最終能否發布,仍取決於輸入素材、模型授權、輸出內容與使用平台規範。
ComfyUI 常見問題
ComfyUI 免費嗎?
ComfyUI 核心是開源工具,可以免費在本機安裝。你仍要負擔自己的硬體、電力與儲存成本。使用 Comfy Cloud、第三方 API 或租用雲端 GPU 則可能另外計費。API 是讓 ComfyUI 連接外部模型服務並自動送出生成請求的程式介面。
ComfyUI 一定要 NVIDIA 顯示卡嗎?
不一定。官方目前支援 NVIDIA、AMD、Intel GPU、Apple Silicon 與 CPU 等不同環境,但各模型和節點的相容性不同。若想降低入門排錯成本,Windows 搭配支援良好的獨立 GPU,或 Apple Silicon Mac 使用官方 Desktop,會比特殊硬體組合容易。
8GB 顯存可以做 AI 影片嗎?
可以嘗試 Wan 2.2 5B 搭配 ComfyUI 原生 offloading 和較小測試設定。這是能否跑通的起點,不是速度與畫質保證。高解析度、長片、多人物與大型模型通常需要更多顯存或更久等待。
Z-Image-Turbo 和 Wan 2.2 要選哪一個?
兩者不是競爭關係。Z-Image-Turbo 用來生成圖片,Wan 2.2 用來生成影片。建議先用 Z-Image-Turbo 完成構圖,再用 Wan 2.2 讓圖片動起來。
ComfyUI 圖片真的能保存完整工作流嗎?
ComfyUI 生成的原始圖片可以包含工作流中繼資料,拖回介面後恢復節點。社群平台重新壓縮或轉檔可能刪除這些資料,所以正式專案仍要另外匯出 JSON。
ComfyUI 生成內容可以商用嗎?
要看模型授權與輸入素材。Z-Image-Turbo 和 Wan 2.2 的官方頁面標示 Apache 2.0,但 MiniMax H3 本機輸出的商業使用需要另外取得授權。即使模型允許商用,也不能忽略角色、Logo、照片、聲音與音樂的權利。
結論:先跑通一條最小工作流,再追求大型模型
ComfyUI 最容易讓人卡住的地方,不是節點太難,而是第一次就同時更換安裝包、模型、外掛、工作流與參數。任何一個環節出錯,最後只會看到紅色節點或顯存不足,卻不知道問題在哪裡。
最實際的學習順序是:官方 Desktop → 官方圖片模板 → Z-Image-Turbo → 保存 JSON → Wan 2.2 5B 圖生影片。每一步都先保留預設設定,確認成功後才改一個變因。
MiniMax H3 等大型模型可以留到真正需要多模態參考與原生音訊時再評估。能下載最大的模型,不代表能完成最好的作品。對新手來說,一條能重現、能排錯、能安全分享的工作流,比一張偶然成功的展示圖更有價值。
資料來源
- 黃小木:本地大模型當導演,從此看片不求人,發布日期:2026 年 8 月 28 日。
- ComfyUI:System Requirements,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Comfy Desktop for Windows,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Comfy Desktop for macOS,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Getting Started with AI Image Generation,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Built-in Workflow Templates,查詢日期:2026 年 8 月 30 日。
- ComfyUI:ComfyUI-Manager Installation,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Custom Nodes,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Z-Image-Turbo Workflow,查詢日期:2026 年 8 月 30 日。
- Tongyi-MAI:Z-Image-Turbo Model Card,查詢日期:2026 年 8 月 30 日。
- ComfyUI:Wan 2.2 Workflow,查詢日期:2026 年 8 月 30 日。
- Wan-Video:Wan 2.2 GitHub Repository,查詢日期:2026 年 8 月 30 日。
- MiniMax:MiniMax H3 Open Weights,發布日期:2026 年 8 月 3 日。
- ComfyUI:MiniMax H3 Workflows,查詢日期:2026 年 8 月 30 日。