Paint-Anything 是什麼?用 Hex 色碼控制 AI 生圖與改色,色彩分數提升 85.3%
Paint-Anything 用同一套 Hex prompt 控制 AI 生圖與改色。本文釐清 85.3% 相對提升、Paint-500K、純色 anchors 與尚未公開的部分。
AI 生圖很會理解「紅色跑車」或「藍色洋裝」,但設計師真正需要的通常不是大概的紅與藍,而是明確的品牌色碼,例如 #FF5733 或 #10A9FF。同一個顏色名稱可能對應許多色調,模型也常產生看起來合理、數值卻相差很遠的顏色。
ByteDance Seed 等研究團隊在 2026 年 9 月提出 Paint-Anything,讓使用者直接在文字 prompt 中用 24-bit Hex 色碼指定物件顏色。同一套介面既能生成新圖片,也能修改現有圖片,不需要額外的 color encoder 或推論時最佳化。
在 FLUX.2-4B 上,Paint-Anything 把 ACBench-T2I 平均分數從 37.02 提高到 68.58,相對提升 85.3%。圖片改色則從 58.90 升到 75.57,相對提升 28.3%。這是 benchmark 的相對改善,不代表每個像素都會完全等於指定色碼,也不等於已成為可下載的商用產品。
Hex 色碼為什麼比「紅色」更難?
24-bit Hex 使用六個十六進位數字表示 RGB,例如 #FF0000 是純紅,#00FF00 是純綠。每個通道有 256 種值,總共可表示約 1,677 萬種顏色。
語言模型能把「紅色」和常見語意連起來,但 #D94A38 與 #E14B35 的文字外觀很相近,數值意義卻不同。圖像模型還要把色碼綁定到正確物件,而不是把整張圖一起染色。
真實照片也有光影、材質與反射。同一件藍色外套在亮處、暗處與金屬反光附近,像素值不會完全相同。設計目標應理解為物件的主色忠於 Hex,而不是把每個像素塗成純色方塊。
Paint-Anything 的統一介面怎麼用?
Paint-Anything 把色碼包在文字標記中,例如 <color>#AABBCC</color>。生成任務可寫「一張有 <color>#10A9FF</color> 檯燈的桌面照片」,編輯任務則指定把既有物件改成某個色碼。
模型沒有外接一條專門的顏色控制支線。研究者直接 fine-tune 原本的圖像模型,讓它在文字 prompt 內學會 Hex string、物件名稱與視覺顏色之間的關係。
這項設計的實用性在於工作流一致。設計工具不必在生成、局部編輯與色票之間轉換不同格式,理論上可用同一種 prompt-native syntax 處理多個物件與多個顏色。
Paint-500K 如何建立顏色訓練資料?
研究團隊從 internal high-quality real images 建立 Paint-500K。資料分成 400,000 個 text-to-image samples 與 100,000 個 editing samples。
T2I 部分包含 100,000 個 single-object examples 與 300,000 個 multi-object examples。多物件資料用來訓練「哪個色碼屬於哪個名詞」,避免把 A 物件的顏色套到 B 物件。
資料處理先用 VLM,也就是能理解圖片與文字的視覺語言模型,找出 caption 相關物件與 bounding boxes。再用 SAM3 取得 object mask,最後在 CIELAB color space 以 MeanShift clustering 估算 dominant color。
CIELAB 是較接近人眼感知差異的顏色空間。MeanShift 不必事先指定固定群集數,適合處理一個物件同時包含亮部、陰影和反射的情況。研究隨機人工檢查 100 筆,96 筆 dominant-color labels 與人類感知一致。
Editing data 則先用圖像編輯模型把原圖物件改成另一種顏色,再把原始照片當 target,指示模型恢復原本 Hex。這樣生成瑕疵只存在 source,target 仍是真實圖片。

為什麼還需要純色錨點?
真實照片只能提供 approximate color。陰影會讓 #3366CC 的物件出現深藍、灰藍和高光,模型很難只靠照片學到精確的 Hex-to-RGB mapping。
Paint-Anything 加入 10,000 張 512×512 pure-color images。每張圖片像素完全等於對應 Hex,像一本沒有光影干擾的數位色票。
但研究者沒有在所有 training timesteps 都使用純色。這些 anchors 只在 high-noise 的 t∈[0.8,1.0] 啟用,讓模型在早期結構尚未成形時學色碼與整體 RGB 統計。到了 low-noise 階段,仍以 natural images 學材質、光影和細節。
Ablation 顯示,timestep-gated anchors 相對 ungated anchors 在 ACBench-T2I 增加 4.75 points,在 ACBench-Edit 增加 5.18 points。只餵純色會失去自然感,只餵照片又缺乏精確色彩基準,時間門控試圖平衡兩者。
ACBench 怎麼測顏色忠實度?
Any Color Benchmark 分為 ACBench-T2I 與 ACBench-Edit。T2I 有 1,000 prompts,其中 500 題指定單一物件與一個 Hex,另外 500 題指定兩個物件與不同 Hex,測 compositional color binding。
Edit 有 500 個 real-image recoloring prompts,每題指定一個目標物件與色碼。評測固定 object region,計算生成或編輯結果與 requested Hex 的 color fidelity。
| FLUX.2-4B | ACBench-T2I 平均 | ACBench-Edit | CompColor Hex 平均 |
|---|---|---|---|
| Base | 37.02 | 58.90 | 0.38 |
| + Paint-Anything | 68.58 | 75.57 | 0.79 |
| 相對變化 | +85.3% | +28.3% | 超過兩倍 |
85.3% 是 (68.58 - 37.02) / 37.02 的相對提升,不是增加 85.3 個百分點。絕對差是 31.56 points。Edit 絕對增加 16.67 points。
圖片真的更接近指定色嗎?
官方 qualitative comparison 顯示,Base model 常產生語意合理的顏色,例如 prompt 要某個藍色時確實畫出藍色,但與指定 Hex 的數值距離仍大。Fine-tuned model 在相同 prompt 下更接近 target swatch。

CompColor 也顯示 word-to-hex gap。Base FLUX.2-4B 用 named colors 時平均 0.72,改成 raw Hex 後掉到 0.38。Paint-Anything 用 Hex prompts 可到 0.79,named-color average 也從 0.72 升到 0.79。
這表示 fine-tuning 沒有只背一套特殊評測格式,至少在另一個 compositional color benchmark 上也改善。但所有分數仍依賴 object masks、color metric 與指定 benchmark distribution。
人類看得出差異嗎?
研究找 15 位參與者,對 80 個 ACBench-T2I prompts 做 1,200 次 color-preference judgments。Paint-Anything 勝出 55%、平手 32%、落敗 13%。排除平手後,win rate 為 80.9%。
畫質比較則是勝 22%、平 58%、敗 20%,排除平手後為 52.4%。因此較安全的結論是顏色符合度有明顯偏好,而整體 image quality 大致接近,不能說畫質全面超越 Base。
參與者與 prompts 會重複出現在多次判斷中。論文也提醒,這些是描述性結果,不能當成每張圖的自動 metric 都與人類判斷一致。
它能直接用在品牌設計嗎?
Paint-Anything 解決的是 object-level dominant color control,距離完整品牌色管理仍有差距。品牌工作常要求印刷色、螢幕色、不同材質的色彩管理,以及在特定光源下保持可預期外觀。
模型輸出仍是渲染後圖片,光影會讓局部 pixels 偏離 Hex。若要製作 logo、包裝刀模、印刷 proof 或法規要求的顏色,仍需專業色彩管理與人工校正。
論文也明確指出目前 training data 沒有 palette-specific supervision。它能在 prompt 裡放多個物件與色碼,不代表已學會完整色票規則、色彩和諧或品牌 palette 約束。
模型和資料有公開嗎?
截至這次查核,論文與 arXiv HTML 可公開閱讀,但沒有找到作者正式發布的 Paint-Anything code、checkpoint 或 Paint-500K dataset。
Paint-500K 來源是 internal image collection,文中明確說 source collection not publicly available。即使方法細節充分,外部團隊也無法用完全相同來源資料一比一重現。
因此目前應把 Paint-Anything 視為研究方法與 benchmark result,不應寫成讀者已能下載安裝的產品。未來若官方釋出 code、weights 或 demo,還要再核對 license 與商用條款。
Paint-Anything 常見問題
它和舊的 Paint3D 或 Segment Anything 專案相同嗎?
不同。這篇 Paint-Anything 是 2026 年的 Hex color-control 研究,目標是 2D 圖片生成與編輯,不是 3D 貼圖或筆觸繪畫工具。
任意 Hex 代表每個像素都完全符合嗎?
不是。目標是物件層級的 color fidelity。自然圖片中的陰影、反射與材質會讓像素偏離主色。
85.3% 是準確率嗎?
不是。它是 ACBench-T2I score 從 37.02 到 68.58 的相對提升,絕對增加 31.56 points。
同一模型能做生成和編輯嗎?
研究的核心就是共用 Hex prompt interface,並以 generation 與 editing data 一起 fine-tune。同一套語法可處理兩種任務。
現在可以下載嗎?
目前找到論文與官方圖表,尚未找到作者正式 code、checkpoint 或公開資料集。不要把同名的舊 GitHub 專案誤當成這篇研究。
結語:設計師需要的不是「紅色」,而是可指定的紅
Paint-Anything 把顏色控制從模糊形容詞推進到可輸入的 Hex interface。Paint-500K 提供 object-level supervision,pure-color anchors 補上精確 RGB 參考,再以 timestep gate 保留自然圖片的材質與光影。
FLUX.2-4B 在 ACBench-T2I 的 37.02 到 68.58、Edit 的 58.90 到 75.57,顯示這條方法有效。更重要的是,Hex prompts 在 CompColor 上也從 0.38 提到 0.79,說明模型真的縮小了 word-to-hex gap。
限制同樣清楚:內部資料未公開、code 和 checkpoint 尚未找到、palette supervision 尚未加入,Hex 也不是印刷或品牌色彩管理的替代品。這是一個值得追蹤的研究方向,但距離設計團隊可驗收的 production tool,還需要公開模型、更多真實工作流測試與明確授權。