微軟 FrogNano 4B 是什麼?小型 AI 程式代理,也能在專案裡找錯與產生修補
微軟 FrogNano 是從 Qwen3.5-4B 訓練的小型程式代理,透過 Leaf 工具讀檔、改碼與測試。本文解釋 61.5% 評測含義、硬體需求,以及模型仍以英文和 Python 專案為主的限制。
FrogNano 是微軟開放的小型程式代理模型,目標是依照問題描述,在既有程式專案裡找錯、修改檔案並產生修補提案。4B 表示約 40 億參數級別,參數是模型學到的數值。
這款模型出現在 10 月 3 日的 AI 社群新聞整理中,但官方模型卡列出的發布日是 2026 年 9 月 22 日,不能把它寫成今天才首度發布。它值得研究的地方,是較小模型如何靠實際任務與測試回饋,學會完成跨檔案的軟體工作。

它處理整個專案,不只續寫一行程式
微軟官方模型卡說明,FrogNano 以 Qwen3.5-4B 為起點,額外訓練聚焦文字形式的軟體工程任務。
程式代理和單次程式碼補全不同。它可能先讀取問題、搜尋相關檔案,再修改程式,執行測試,最後依回饋調整。這種工作需要理解專案現況,不能只看一小段程式。
FrogNano 使用 Leaf 這套代理工具框架,提供讀取、寫入、編輯、檔案搜尋與命令執行五類工具。模型提出工具請求,由框架在隔離的專案環境執行,最後產生候選修補,不會由模型本身直接部署到線上服務。
約 1,500 個任務,讓測試結果提供回饋
官方說明,FrogNano 的額外訓練使用約 1,500 個合成軟體工程任務環境,由 TaskPilot 產生、驗證並依模型當下能力調整。
訓練採用強化學習,也就是讓模型根據執行結果的獎勵學習。這裡的回饋來自可執行測試,包含新問題是否修好,以及既有功能是否仍正常。
官方特別區分:它沒有用較強模型完成任務的推理過程、動作或修補答案,作為代理行為訓練目標。這不代表合成任務完全沒有 AI 參與;TaskPilot 仍會生成問題、參考修補與測試來建立環境。
61.5% 是哪一種分數?
在 SWE-bench Verified 評測裡,同樣使用 Leaf 框架的基礎模型 Avg@3 約為 39.4%,FrogNano 經過五輪訓練後達到 61.5%,增加 22.1 個百分點。
Avg@3 在這裡是三個不同隨機種子下,單次任務成功率的平均。它和 Pass@3 不同。後者看三次嘗試中至少一次成功。模型卡也另外公布 Pass@3,不能把兩種分數混成同一件事。
SWE-bench Verified 用真實程式庫問題與測試評估修補。這組分數支持模型在指定設定裡有改善,卻不表示你自己的專案也會有 61.5% 成功率。
小型模型,不代表所有電腦都能順跑
模型卡估計,BF16 格式的模型權重(可下載部署的核心參數)本身約需 9.3 GB,執行狀態和長內容的暫存還會使用額外記憶體。
官方記錄的運行設定使用 GPU 伺服器,尚未驗證 CPU、桌面系統、手機或各種量化格式。量化是用較少位元表示數值以減少容量的方法。即使社群有人轉換格式,也需要個別確認效果。
我會把「小型」理解為相對模型規模,而不是隨便一台電腦都能使用的承諾。部署前仍需要對照架構支援、記憶體與工具執行環境。
英文與 Python 是主要驗證範圍
官方描述的訓練資料主要是英文需求與 Python 專案。其他自然語言、程式語言和不同專案結構,沒有同等程度的驗證。
此外,雖然基礎模型包含視覺元件,FrogNano 的專門訓練與評估沒有涵蓋圖片和影片,因此官方不把它們列為支援功能。
我會先用範圍清楚、測試可重現的小問題觀察它。修補通過現有測試仍可能留下未涵蓋的問題,所以需要人讀懂變更,再決定是否合併。
常見問題
它是一般聊天助理嗎?
官方定位是軟體工程研究與有人監督的開發工作,沒有把它當成全面用途的聊天模型。
可以直接看圖片找 UI 問題嗎?
官方未支援 FrogNano 的圖片與影片用途。不能把基礎模型的多模態能力直接套到專門訓練後的模型。
通過測試的修補就能直接上線嗎?
模型產生的是候選修補,仍需檢查需求、變更與回歸測試,再安排實際合併或部署。
結語:把小模型放回完整工具流程
FrogNano 的研究亮點,是用任務環境與測試回饋提升小型程式代理。它也提醒我們,模型、工具框架與驗收條件一起決定了結果。
我會從官方已驗證的英文與 Python 情境開始評估,保留實際修補和測試證據。模型比較小可以降低部分門檻,但可靠開發仍需要完整的工作流程。