Kimi K3 開放權重下載:2.8 兆參數、100 萬 Token,真的能在本機執行嗎?

Kimi K3 完整權重已開放下載,但 1.56 TB 模型檔案與 64 顆以上加速器建議,讓「開放權重」不等於一般電腦可跑。本文整理能力、授權、價格與部署門檻。

Share
Kimi K3 官方封面,呈現 Moonshot AI 開放權重模型的品牌視覺
Moonshot AI 於 2026 年 7 月發布 Kimi K3。圖片來源:Kimi 官方

Moonshot AI 已在 2026 年 7 月 27 日釋出 Kimi K3 完整模型權重。這款模型擁有 2.8 兆總參數、1040 億啟用參數、原生圖像理解能力,以及最長 100 萬 Token 的 context window,主打長時間 Coding、研究與工具操作。

「完整權重可以下載」是這次最重要的進展,但也最容易被誤解。Kimi K3 的權重檔案約 1.56 TB,官方更建議使用 64 顆以上加速器的 supernode 部署。換句話說,它確實比只能透過雲端 API 使用的封閉模型更開放,卻不是下載到一般電腦就能離線執行的本機模型。

我的判斷是:Kimi K3 已經成為值得 AI 開發團隊測試的前沿級開放權重模型,尤其適合長流程 Agent 與大型程式庫任務;但對多數個人與中小型團隊,直接使用 Kimi 網頁、Kimi Code 或 API,仍比自行部署實際。

Kimi K3 是什麼?先看完整規格

Kimi K3 是 Moonshot AI 推出的原生多模態 Agent 模型。原生多模態代表它可以直接理解文字與圖片;Agent 則表示模型不只回答問題,也能規劃步驟、操作工具、查看執行結果,再繼續修正。

項目 Kimi K3 規格
模型架構 Mixture of Experts(MoE,混合專家)
總參數量 2.8 兆
每次推論啟用參數 1040 億
專家數量 896 個,每個 Token 選擇 16 個
Context window 1,048,576 Token
輸入形式 文字、圖片
輸出形式 文字
原生量化 MXFP4 權重、MXFP8 activation
權重下載 Hugging Face
程式碼與技術報告 GitHub
雲端使用 Kimi、Kimi Work、Kimi Code、Kimi API

MoE 可以理解成一個大型專家團隊。K3 雖然共有 2.8 兆參數,但每次處理一個 Token 時,只會選擇 896 個專家中的 16 個參與運算,因此實際啟用約 1040 億參數。這比每次都運算完整 2.8 兆參數有效率,但 1040 億仍是非常大的規模。

這也說明為什麼不能只看「每次只用部分參數」就推論 K3 很容易部署。模型總權重仍要被儲存並分散到多張加速卡,專家之間的資料傳輸也會形成新的硬體與網路瓶頸。

Kimi K3 已開放下載,但不等於一般電腦跑得動

Kimi K3 的 Hugging Face 模型庫已提供 96 個 safetensors 權重分片。模型索引記錄的總大小為 1,560,860,324,864 bytes,約 1.56 TB。

這個容量還只是檔案大小。實際推論時,系統還要為 context、KV cache、中間運算與多卡通訊保留額外資源。Moonshot AI 在官方技術文章中建議使用 64 顆以上加速器的 supernode,並列出 vLLM、SGLang 與 TokenSpeed 等推論引擎。

因此,K3 的「開放」主要帶來三種價值:

  1. 有大型基礎設施的企業,可以在自己的環境部署,不必把資料交給第三方 API。
  2. 研究團隊可以檢查模型結構、測試不同推論方法,或建立衍生版本。
  3. 雲端推論服務商可以部署 K3,讓一般開發者透過較容易使用的 API 接入。

對個人開發者來說,最合理的路徑不是先買硬體,而是先用 API 或支援 K3 的推論服務驗證任務價值。只有當資料治理、使用量或客製化需求足以抵銷基礎設施成本,自建部署才有商業意義。

開放權重不等於完全開源:Kimi K3 License 有哪些限制?

Kimi K3 使用自訂的 Kimi K3 License,不是 Apache 2.0、MIT 等常見開源授權。授權允許使用、修改、發布、再散布、微調與建立衍生作品,也涵蓋多數商業用途,但大型服務仍有額外條件。

其中兩項門檻最值得注意:

  • 如果業者提供「Model as a Service」,讓第三方透過 API 控制模型輸入、參數或訓練資料,而且業者及關係企業連續 12 個月總營收超過 2,000 萬美元,商業使用前必須另與 Moonshot AI 簽訂協議。
  • 如果商業產品或服務超過 1 億月活躍使用者,或月營收超過 2,000 萬美元,使用者介面必須明顯顯示「Kimi K3」。

這代表多數研究、內部使用與中小規模商業產品並非一律需要另購授權,但導入前仍要依產品模式核對條款。更精確的說法是「開放權重、採自訂商業授權」,不宜直接簡化成沒有任何限制的「完全開源」。

Kimi K3 的技術重點:不是只把參數做大

Kimi K3 使用 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)。KDA 的目標是提高長內容中的注意力效率;AttnRes 則讓模型可以從不同深度選取需要的表示,而不是一路把所有中間資訊平均累積。

Moonshot AI 表示,搭配更稀疏的 MoE、Stable LatentMoE 與新的訓練方法後,K3 相較 Kimi K2 的整體 scaling efficiency 約提高 2.5 倍。這是官方測量結果,不能直接解讀成所有任務都快 2.5 倍,或 API 成本會下降 60%。

真正值得觀察的是長流程穩定性。當 Agent 要在大型程式庫持續工作、查閱大量文件,或反覆查看畫面並修正結果時,模型能不能維持目標,比一次容納多少文字更重要。K3 的架構與訓練方向,正是要把長 context 轉換成長時間工作的能力。

Coding 與 Agent 能力:K3 想競爭的是完整工作流程

Moonshot AI 把 Coding 放在 K3 的核心位置。官方案例包含最長 24 小時的 GPU kernel 最佳化、從零建立名為 MiniTriton 的 GPU 編譯系統,以及在一次 48 小時自主流程中使用開源 EDA 工具完成晶片設計、最佳化與模擬驗證。

這些案例的共通點不是「模型會寫一段程式」,而是模型要自己規劃、呼叫工具、執行、檢查,再持續修正。對開發團隊來說,這比單次程式題更接近日常工作,也更容易暴露模型是否會偏離需求、破壞既有檔案,或在失敗後無法恢復。

K3 也具備視覺回饋能力。模型可以產生前端或遊戲程式,再查看實際畫面並調整。這種「vision in the loop」對前端、遊戲、CAD 與視覺化工作有實際價值,因為使用者不必把每個畫面錯誤重新翻成文字。

Kimi K3 產生的瀏覽器 3D 開放世界遊戲畫面
Kimi K3 透過程式、畫面回饋與外部 3D 素材完成可遊玩的瀏覽器開放世界。圖片來源:Kimi 官方

不過,官方案例仍是經過設計的展示,不能直接當成一般專案成功率。比較務實的測法,是挑一個團隊原本需要 2 至 4 小時、同時包含檔案修改、工具操作與驗證的任務,讓 K3、GPT 與 Claude 使用相同輸入、權限和驗收標準,再比較完成率與人工修正時間。

Kimi K3 官方知識工作 benchmark,比較多種模型的工作任務表現
Moonshot AI 內部評測顯示 Kimi K3 在多項知識工作任務具有競爭力;這是官方結果,不等於獨立驗證。圖片來源:Kimi 官方

Kimi K3 Benchmark 怎麼看?第三方數據支持實力,也暴露速度問題

Moonshot AI 公布的評測顯示,K3 在部分長流程 Coding 與 Agent 任務已接近前沿封閉模型,但不是每一項都領先。

Benchmark Kimi K3 官方比較中的較高分 解讀
DeepSWE 67.5 GPT 5.6 Sol:73.0 軟體工程能力強,但並非第一
Terminal-Bench 2.1 88.3 GPT 5.6 Sol:88.8 終端工具任務接近前段
SWE-Marathon 42.0 Kimi K3:42.0 長流程 Coding 表現突出
GPQA Diamond 93.5 GPT 5.6 Sol:94.1 高難度知識推理接近前段
Kimi K3 與 GPT、Claude、GLM 的官方 Coding benchmark 比較
Kimi K3 在部分長流程 Coding 評測接近或領先其他模型,但各模型使用的工具與測試條件不完全相同。圖片來源:Kimi 官方

這些結果不能合併成「K3 全面超越 GPT 或 Claude」。官方註解顯示,不同模型可能搭配 Kimi Code、Claude Code 或 Codex 等不同 harness;harness 是模型執行任務時使用的工具與流程,換了工具就可能改變成績。

第三方評測提供了更完整的取捨。2026 年 7 月 28 日查詢 Artificial Analysis,K3 在其 Intelligence Index 得分 57,支持它已進入高能力模型區間;但官方 API 的實測輸出速度約為每秒 32.6 Token,第一個 Token 延遲約 121.3 秒。它的優勢是能力與開放權重,不是低延遲。

Artificial Analysis 也記錄 K3 在評測中產生約 1.3 億個輸出 Token,內容量高於比較模型的中位數。對產品團隊來說,這會同時影響等待時間與費用,因此不能只看答對率。

Kimi K3 怎麼用?個人、開發者與企業有不同選擇

一般使用者:直接使用 Kimi

一般使用者可以從 Kimi 網頁或 App 使用 K3,適合研究、文件整理、簡報與多步驟任務。這是門檻最低的方式,也不需要處理模型部署。

開發者:使用 Kimi Code 或 API

Kimi Code 可以在 terminal 中使用,並透過 /model 選擇 Kimi K3。API 則可把模型接進自家產品,官方價格如下:

計費項目 每 100 萬 Token
Cache hit input US$0.30
Cache miss input US$3.00
Output US$15.00

Cache hit 是系統重複使用已處理過的相同前綴內容,輸入價格因此較低。官方表示 Coding 工作負載的 cache hit rate 可超過 90%,但不同產品的提示詞結構與重複率不同,不能把 90% 當成所有應用的成本假設。

企業與研究單位:評估自建部署

自建部署的優勢是資料留在自己的環境,也能調整推論框架與模型。代價則是 1.56 TB 權重、多卡通訊、監控、版本更新與維運成本。若團隊還沒有成熟的 GPU 叢集,先使用 API 完成 MVP,再根據實際流量計算自建損益,通常更快也更容易維護。

延伸閱讀:NVIDIA 輝達股票(NVDA)怎麼買?2026 完整投資指南:值得買嗎、4 種購買管道、台灣概念股一次看懂

Kimi K3 的 4 個限制

第一,K3 對 thinking history 很敏感。Thinking history 是模型先前的推理與工具操作紀錄;若 Agent 工具沒有完整傳回,或在同一段任務中途切換模型,生成品質可能變得不穩定。

第二,K3 可能過度主動。官方承認,模型遇到小問題或模糊意圖時,可能替使用者做出未預期的決定。涉及檔案修改、寄信、付款或對外發布時,應在 system prompt 或 AGENTS.md 明確限制權限、停止條件與需人工確認的動作。

第三,速度與回應延遲不是它的強項。長時間 Agent 任務或許能接受較慢的第一個回應,但即時客服、互動式搜尋與大量短請求就可能受到影響。

第四,開放權重不會自動降低部署成本。K3 可以由企業自行掌控,卻需要大型硬體與維運能力。對多數團隊來說,這是資料控制與技術彈性的選項,不是免費算力。

Kimi K3 值得用嗎?

我的立場是中性偏多。

看多的原因有兩個:第一,完整權重已經實際發布,不再只是未兌現的開放承諾;第二,官方與第三方評測都顯示 K3 已經具備前沿級推理、Coding 與 Agent 能力。

但它只適合特定使用者。需要長流程 Coding、研究、視覺回饋,或有資料私有化需求的團隊,值得把 K3 放進模型評估清單。重視即時回應、低成本短任務,或沒有 GPU 基礎設施的團隊,K3 不一定比更小、更快的模型實際。

會讓我下修評價的證據,是第三方在相同 harness 與成本限制下,發現 K3 的長流程成功率明顯低於官方數字,或模型的過度主動與 thinking history 相容性持續造成生產事故。現階段最合理的行動,不是因為「2.8 兆參數」就全面切換,而是用一個真實工作流程做受控測試。

FAQ

Kimi K3 是開源模型嗎?

更精確的說法是「開放權重模型」。完整權重已公開下載,使用者可以部署、修改與建立衍生作品,但它採用自訂 Kimi K3 License,部分大型商業服務有額外協議或品牌標示要求。

Kimi K3 可以在一般電腦執行嗎?

不適合。K3 權重檔案約 1.56 TB,官方建議使用 64 顆以上加速器的 supernode。個人與多數中小型團隊使用 Kimi 網頁、Kimi Code 或 API 會更實際。

Kimi K3 有多少參數?

Kimi K3 有 2.8 兆總參數,採 MoE 架構,每個 Token 從 896 個專家中選擇 16 個,實際啟用約 1040 億參數。

Kimi K3 比 GPT 或 Claude 強嗎?

K3 在部分長流程 Coding 與 Agent 評測接近或領先部分封閉模型,但不是所有項目第一。不同模型搭配的 harness、推理強度與測試條件也不完全相同,因此不能下全面勝出的結論。

Kimi K3 適合哪些使用者?

它較適合需要大型程式庫操作、長時間研究、多步驟工具使用、視覺回饋或私有部署的團隊。只需要快速問答、低延遲客服或大量簡單任務時,較小的模型通常更省成本。

資料來源

Read more

AI 讓工作更快,還是只是讓人更忙?2026 AI 郵報讀者調查正式上線

AI 讓工作更快,還是只是讓人更忙?2026 AI 郵報讀者調查正式上線

AI 郵報啟動 2026 年度讀者調查,從效率、收入到職場中的 AI 能力落差,了解最常接觸 AI 的這群人,究竟把工具變成了成果,還是換來更多工作。 生成式 AI 已經進入許多人的日常。有人用它寫信、整理資料,有人把它放進工作流程,甚至靠 AI 接案、開發產品或創造新的收入。 但當 AI 工具越來越普及,一個更實際的問題也逐漸浮現:我們真的因為 AI 變得更有效率了,還是只是在相同時間裡,被交付了更多工作?這也是 AI 郵報發起「2026 AI 郵報讀者調查」的原因。 不只問你有沒有用 AI,而是用了之後發生什麼事 多數 AI 調查關心的是使用率、熱門工具或使用頻率。但「有沒有使用 ChatGPT」,已經不足以描述