Gemini 3.8 正式發布:Flash、Flash Cyber、價格與 Claude Benchmark 完整整理

Google 正式發布 Gemini 3.8 Flash 與 Flash Cyber。本文整理使用通路、API 價格、Agent benchmark、資安能力與 Claude 比較。

Share
Google 正式發布 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber
Google 在 2026 年 9 月 2 日推出 Gemini 3.8 Flash 與限制性存取的 Flash Cyber。 圖片來源:Google 官方公告(https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/)

2026 年 9 月 2 日晚間,一則 X 貼文先曝光 Gemini 3.8 Flash 的比較圖。約半小時後,Google 官方 X 帳號正式宣布 Gemini 3.8,並一次推出 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber 兩個版本。

這次不是只有模型名稱與 benchmark。Google 同步公開完整產品公告,並在 Gemini API Release notes 將 gemini-3.8-flash 列為 GA,也就是已達到一般可用、可供正式產品採用的穩定版本。

Google 把 Gemini 3.8 稱為旗下目前最強的推理與 Coding 模型,但這句話要放回產品脈絡理解。Gemini 3.8 Flash 是以 3.7 Flash 為基礎的快速迭代,而 Flash Cyber 則把同一套核心能力專門用於找出與修補軟體漏洞。

我的結論是:Gemini 3.8 Flash 已是很有競爭力的大量 Coding 與 Agent 任務選擇。Gemini 3.8 Flash Cyber 的能力也很亮眼,但它採限制性部署,一般使用者無法直接選用。如果任務牽涉高難度電腦操作或廣泛知識工作,Claude Opus 5 仍有明顯優勢。

Gemini 3.8 Flash 是否已正式發布?

答案是有,而且不是只有 Gemini 自己聲稱「正在使用 3.8」。Google 官方在 2026 年 9 月 2 日留下了四層可交叉確認的發布證據:

  1. Google 官方 X 貼文 宣布 Gemini 3.8 與兩個新版本。
  2. Google 官方產品公告 公開功能、案例、使用通路與 Cyber 部署方式。
  3. Gemini API Release notes 宣布 Gemini 3.8 Flash 已進入 GA。
  4. Gemini API 模型目錄 將它列在 Stable 類別,API 型號是 gemini-3.8-flash

GA 是 General Availability 的縮寫,意思是模型已從測試階段進入一般可用狀態,開發者可以用固定的 stable model ID 串接,不是只能等待名單或使用隨時可能撤下的實驗型號。

開發者可在 Google Antigravity、Google AI Studio、Android Studio、Stitch 與 Gemini API 使用 3.8 Flash,企業則可透過 Gemini Enterprise 存取。消費者端目前提供給 Google AI Pro 與 Ultra 訂閱者,通路包含 Gemini app、Google Search 的 AI Mode,以及 Google Sheets。你的選單還沒看到 3.8,不代表模型尚未發布,但免費帳號也不在這次官方列出的消費者開放範圍內。

Gemini 3.8 Flash 是什麼?它和 3.7 Flash 有什麼關係?

Gemini 3.8 Flash 是 Gemini 3 系列的快速、高效率模型。Flash 不只是把大模型縮小,它還要在能力、速度與成本之間取得平衡,讓企業可以大量執行 Coding、資料分析與 Agent 工作。

Agent 指的是能自行拆解任務、呼叫工具並持續完成多個步驟的 AI。舉例來說,一般聊天模型可能只告訴你怎麼修程式。Agent 則可以讀取專案、修改檔案、執行測試,再根據錯誤繼續修正。

這次最容易被忽略的事,是 Gemini 3.8 Flash 建立在 3.7 Flash 之上。Google 在六週內已推出三次 Flash 更新,3.8 距離 3.7 也只有三週。它比較像一次快速而集中的能力升級,不代表 Google 推出了新的模型架構。對使用者來說,這反而可能更實際:價格沒有先上漲,原本的輸入格式與工具能力也大致延續,但幾個工作型 benchmark 出現明顯進步。

Google 這次還特別提到 long-running agentic loops,也就是在模型開發過程中,讓 Agent 長時間反覆評估與改善底層模型。這不代表 Gemini API 突然多了一個會永遠自行執行的按鈕,而是 Google 用來推進 3.8 推理與 Coding 能力的方法。

Gemini 3.8 Flash 規格:支援哪些輸入與工具?

Gemini 3.8 Flash 可以接收文字、圖片、影片、音訊與 PDF,最後輸出文字。它支援最多 1,048,576 個輸入 tokens,約等於常見說法中的 1M context window。單次最多輸出 65,536 tokens。

Context window 是模型一次能讀進去的內容容量。1M context 適合大型程式庫、長影片、合約與多份文件,但「放得進去」不等於每個細節都能穩定找回,重要資訊仍應透過分段測試與實際驗證確認。

在工具方面,3.8 Flash 支援 Code execution、File search、Function calling、Google Search grounding、Google Maps grounding、Structured outputs 與 URL context。Computer use 也能使用,但目前仍是 Preview。

它不支援圖片生成、音訊生成與 Live API。換句話說,3.8 Flash 可以理解圖片、聲音與影片,卻不能直接生圖、生成語音或處理即時雙向語音。若產品需要這些功能,仍要搭配其他 Gemini 或媒體模型。

Thinking effort 提供 low、medium、high 三個層級。Thinking effort 可以理解成讓模型投入多少推理資源。等級越高,複雜任務通常較有機會得到完整答案,但也可能增加延遲與 token 用量。minimal 不在支援範圍內,傳入後會直接回傳錯誤。

Gemini 3.8 Flash 價格多少?

Gemini 3.8 Flash 採用分階段價格。2026 年 12 月 31 日前,Standard API 每 100 萬 tokens 的輸入價格為 US$0.75,輸出為 US$3.75。從 2027 年 1 月 1 日起,將分別調整為 US$1.50 與 US$7.50。

計費項目 2026 年 12 月 31 日前 2027 年 1 月 1 日起
Standard 輸入 US$0.75/1M tokens US$1.50/1M tokens
Standard 輸出 US$3.75/1M tokens US$7.50/1M tokens
Context caching US$0.075/1M tokens US$0.15/1M tokens
Batch/Flex 輸入 US$0.375/1M tokens US$0.75/1M tokens
Batch/Flex 輸出 US$1.875/1M tokens US$3.75/1M tokens

這個價格真正重要的地方,是 3.8 Flash 在優惠期間與 3.7 Flash 同價。開發團隊不用先接受更高的 token 單價,就能取得較好的程式工程、工具操作與知識任務表現。

但單價不等於實際總成本。Google 也提醒,高 effort 可能使用更多 tokens,模型偶爾會變慢或 timeout。如果 3.8 Flash 為了完成同一任務產生更長的推理過程,實際帳單與延遲仍需要用自己的 Prompt、工具與資料測試。

Gemini 3.8 Flash Benchmark 有多強?

官方比較顯示,Gemini 3.8 Flash 的最大價值在於用 Flash 價格逼近甚至超過部分高價模型,即使它沒有在每一項測試拿第一。

Benchmark Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5 GPT-5.6 Sol
DeepSWE v1.1:長時間軟體工程 73.7% 65.3% 74.0% 72.7%
Terminal-bench 2.1:終端機 Coding Agent 89.4% 85.8% 89.1% 88.8%
Terminal-bench 4.0:一般 Agent 能力 19.1% 11.2% 51.8% 37.3%
Vals Finance Agent v2:金融分析 61.4% 59.0% 58.6% 53.8%
OSWorld-2.0:電腦操作 59.0% 50.6% 75.4% 62.6%
CharXiv Reasoning:複雜圖表理解 86.2% 84.5% 83.7% 85.8%
HLE-Verified:跨領域專家推理 54.9% 53.6% 54.4% 54.5%

最醒目的提升出現在 DeepSWE v1.1。3.8 Flash 從 3.7 Flash 的 65.3% 升到 73.7%,只比 Claude Opus 5 的 74.0% 少 0.3 個百分點,並略高於 GPT-5.6 Sol 的 72.7%。如果團隊主要需求是長時間修改程式、追查問題與完成跨檔案任務,這項進步很有實際意義。

Terminal-bench 2.1 也得到 89.4%,小幅超過 Claude Opus 5 與 GPT-5.6 Sol。不過,難度更高、範圍更廣的 Terminal-bench 4.0 出現完全不同的結果:3.8 Flash 雖然從 11.2% 提升至 19.1%,仍遠低於 Opus 5 的 51.8% 與 Sol 的 37.3%。

這組差異提醒我們,不能看到一個 Coding benchmark 就推論所有 Agent 任務都一樣。處理明確的終端機程式工作,與在陌生環境中長時間規劃、操作和排除障礙,是不同能力。

Gemini 3.8 Flash、Gemini 3.7 Flash、Claude Opus 5 與 GPT-5.6 模型價格及 Benchmark 比較
Google 官方比較顯示 Gemini 3.8 Flash 在部分 Coding、金融、圖表與長影片任務領先,但並非每項都拿第一。 圖片來源:Google 官方公告

Claude 仍然「贏得 Agent 競賽」嗎?

原始 X 貼文 說 Claude 仍贏得 Agent 競賽,方向不算錯,但描述太籠統。

Claude Opus 5 在 DeepSWE v1.1 以 74.0% 小幅領先,也在 Terminal-bench 4.0、OSWorld-2.0 與 GDPVal-AA v2 等廣泛 Agent、電腦操作和知識工作測試取得優勢。特別是 OSWorld-2.0,Opus 5 的 75.4% 明顯高於 Gemini 3.8 Flash 的 59.0%,說明 Claude 在操作桌面環境的複雜任務上仍有領先。

但 Gemini 3.8 Flash 並非全面落後。它在 Terminal-bench 2.1、金融分析、法律工作流程、複雜圖表理解、長影片理解與 HLE-Verified 都高於 Opus 5。更重要的是,優惠期間的輸入/輸出價格為 US$0.75/US$3.75,低於官方比較表中 Opus 5 的 US$5/US$25。

因此,更準確的產品判斷是:Claude Opus 5 仍適合高難度、容錯成本高的通用 Agent 與電腦操作。Gemini 3.8 Flash 則更適合需要大量執行、成本敏感,而且任務能被測試與驗證的 Coding、文件、影片與垂直知識工作。

Google 官方展示了哪些 Gemini 3.8 Flash 應用?

Google 公開的示範集中在長時間 Coding、互動介面與真實資料處理,而不是一般聊天問答。其中一個案例只用簡短 Prompt 與循環指令,就在 Google Antigravity 建立包含謎題、場景敘事與材質的 3D 城堡遊戲。

第二個案例把 Google Maps 做成可操作的 DOS 版本,包含地點、路線與 Street View。另一個專案則使用美國地質調查局的真實資料,建立地形剖面、2D 投影與科學說明。Google AI Studio 的 Hardware Anatomy 示範還能把硬體裝置拆成多層 3D 結構,讓使用者拉動滑桿逐層查看。

這些案例的共同點不是畫面炫麗,而是模型需要持續寫程式、使用外部資料、保持狀態並修正結果。這也解釋了 Google 為什麼把 3.8 Flash 定位成 long-horizon coding 與 autonomous agents,也就是能執行較長時間程式任務與自主工作的模型。

0:00
/0:00

Google 示範 Gemini 3.8 Flash 在 Antigravity 中建立帶有謎題、場景與材質的 3D 城堡遊戲。 影片來源:Google 官方公告

Gemini 3.8 Flash Cyber 是什麼?一般人可以用嗎?

Gemini 3.8 Flash Cyber 是這次真正新增、也最容易被漏掉的產品。它和一般版共享核心模型,但針對自動找出漏洞與產生修補程式進行強化。由於資安模型同時可能被用於防禦與攻擊,Google 沒有把它放進公開 API。

Cyber 版本只透過新的 Fairwind Program 提供給可信任的防禦者,優先對象包括政府機關、關鍵基礎設施營運者與軟體維護者。Google 也表示 Cyber 版本採用比一般版更寬鬆的資安能力限制,因此必須用申請與身分審核控制存取。

能力方面,Google 表示 3.8 Flash Cyber 在 CyberGym 漏洞發現 benchmark 超過 3.5 Flash Cyber 與更大型的 frontier models。另一套涵蓋 20 種程式語言的內部漏洞測試成功率超過 70%。因為後者是 Google 內部 benchmark,外界目前無法獨立重現,適合當成產品方向證據,不應直接視為所有程式語言都能達到相同成功率。

在修補漏洞的 CWE-Bench,3.8 Flash Cyber 的 pass@1 為 47.2%,接近領先模型的 47.8%,但 Google 表示成本明顯較低。Pass@1 代表模型第一次嘗試就成功的比例。對資安團隊來說,接近高階模型的修補率只是起點,修補內容仍要經過測試與人工審查,不能讓模型直接修改正式環境。

Gemini 3.8 Flash Cyber 在 CyberGym 漏洞發現 Benchmark 的 Pass at 1 比較
Gemini 3.8 Flash Cyber 在 CyberGym Pass@1 取得 86.2%,但這不代表模型可以取代人工安全驗證。 圖片來源:Google 官方公告

Google 也公布三個實際案例。Chrome Security 團隊發現,3.8 Flash Cyber 產生的正確漏洞修補數量,是最佳大型商用模型的 2.6 倍。Wiz 的內部滲透測試顯示,它的召回率高出 7.5 至 9.7 個百分點,成本則低 2.3 至 5.2 倍。Google Cloud Vulnerability Research 團隊還用它在兩小時內找到一個關鍵底層漏洞,而這類研究通常需要數月。

這些成績支持 Flash Cyber 適合加速防禦工作的判斷,但不能解讀成資安工程師可以被取代。模型找出的漏洞與 patch 都要驗證,Google 也沒有公開每個案例的完整樣本與測試設定。

貼文中的 Benchmark 圖為什麼和官方數字不同?

原始貼文圖片把 Gemini 3.8 Flash 的 DeepSWE v1.1 寫成 71.0%,但 2026 年 9 月 2 日取得的 Google DeepMind 官方 model card PDF 顯示為 73.7%。其餘多數主要數字相同。

Google 的 model card 本身註明,文件可能隨模型改進或評估更新而調整。因此,這篇文章採用目前官方文件的 73.7%,不把社群截圖當成最終版本。這也說明閱讀模型排行榜時,除了看分數,還要確認發布日期、測試設定與資料版本。

Gemini 3.8 Flash 有哪些限制?

第一個限制是 benchmark 不等於你的產品。官方表格混合了程式工程、金融、法律、影片、PDF 與電腦操作測試,並不代表單一模型會在每套 Prompt、工具鏈和語言中維持相同排名。最可靠的做法仍是用自己的任務建立小型評測集,比較成功率、成本、延遲與人工修正時間。

第二個限制是模型仍可能產生幻覺,也可能偶發變慢或 timeout。它的知識截止時間標示為 2026 年 3 月,但官方同時說明,部分領域可能仍只涵蓋到 2025 年 1 月。只要任務牽涉新聞、價格、法規或最新產品資訊,就不應只依賴模型內建知識。

第三個限制來自安全評估。Google 表示 3.8 Flash 整體安全性與語氣接近 3.7 Flash,但非英文語言安全評估退步 5.4 個百分點。對中文客服、教育、醫療或金融產品而言,這不是可以忽略的附註,正式切換前應加入繁體中文的拒答、誤導與越權測試。

第四個限制是兩個版本不能混為一談。Gemini 3.8 Flash 已經 GA,開發者可以透過 API 使用。Gemini 3.8 Flash Cyber 則要申請 Fairwind Program,不能因為 Google 同時發布兩個名稱,就把 Cyber 的漏洞能力寫成一般 3.8 Flash 使用者都能取得。

Gemini 3.8 Flash 值得使用嗎?

如果你正在做 Coding Agent、文件分析、長影片理解,或需要大量呼叫模型完成可驗證的工作,我會把 Gemini 3.8 Flash 放進第一輪測試名單。它在與 3.7 Flash 同價的情況下帶來明顯提升,價格又遠低於官方表格中的 Claude Opus 5 與 GPT-5.6 Sol,這是這次發布最有商業價值的地方。

但我不建議只因官方 benchmark 就把所有工作立即切換。比較實際的 MVP 做法,是先挑 20 至 50 個真實任務,同時跑 3.8 Flash 與目前使用的模型,再記錄完成率、工具錯誤、輸入輸出 tokens、延遲與人工修正時間。只有在自己的工作流也更省錢、更穩定,升級才算真正成立。

若後續獨立實測顯示 3.8 Flash 在繁體中文、高難度電腦操作或長時間 Agent 任務的穩定性不如官方結果,我會降低目前的評價。現階段,它最合理的定位是把高階 Agent 與 Coding 能力推進到更容易大量部署的價格帶,而非全面擊敗 Claude。

Gemini 3.8 Flash FAQ

Gemini 3.8 Flash 已經正式發布了嗎?

已正式發布。Google 在 2026 年 9 月 2 日宣布 gemini-3.8-flash 進入 GA,官方 Gemini API 目錄將它列為 Stable。

Gemini 3.8 Flash 可以在哪裡使用?

開發者可以從 Google AI Studio、Gemini API、Google Antigravity、Android Studio 或 Stitch 使用,企業則可以使用 Gemini Enterprise。消費者端目前開放給 Google AI Pro 與 Ultra 訂閱者,使用範圍包含 Gemini app、Google Search AI Mode 與 Google Sheets。

Gemini 3.8 Flash Cyber 可以直接使用嗎?

一般使用者不能直接選用。Google 只透過 Fairwind Program 提供給通過審核的政府機關、關鍵基礎設施營運者與軟體維護者,申請者需要說明組織與防禦用途。

Gemini 3.8 Flash API 價格多少?

2026 年 12 月 31 日前,Standard API 每 100 萬輸入 tokens 為 US$0.75,輸出為 US$3.75。2027 年 1 月 1 日起,將調整為 US$1.50 與 US$7.50。

Gemini 3.8 Flash 比 Claude Opus 5 強嗎?

沒有單一答案。3.8 Flash 在部分 Coding、金融、法律、圖表與長影片 benchmark 領先。Claude Opus 5 則在高難度一般 Agent、電腦操作與部分知識工作明顯較強。若重視成本與大量執行,3.8 Flash 更有吸引力。若任務失敗代價高,仍要用真實工作流比較。

Gemini 3.8 Flash 可以生成圖片或語音嗎?

不行。它可以理解圖片、影片與音訊,但官方規格只支援文字輸出,也不支援 Live API。生圖、語音或即時對話需要搭配其他模型。

結論:Gemini 3.8 同時推進低成本 Agent 與限制性資安模型

Gemini 3.8 已由 Google 正式發布,這點不再是傳聞。一般版 3.8 Flash 已經 GA,以 3.7 Flash 為基礎,在長時間軟體工程、Agent Coding、金融法律任務與多模態理解上繼續推進。3.8 Flash Cyber 則把相同核心能力用於漏洞發現與自動修補,但只提供給通過審核的防禦單位。

一格 benchmark 變成藍色不會直接改變產品決策,US$0.75/US$3.75 的優惠單價才是關鍵。3.8 Flash 已能在部分任務逼近甚至超過高價模型。對產品團隊來說,這會直接改變模型路由方式:高價模型不必處理每一個任務,可以只留給最困難、失敗成本最高的工作,其餘流量交給 3.8 Flash。

但官方結果也清楚顯示,Claude Opus 5 在高難度通用 Agent 與電腦操作上仍有優勢。最實際的決策是先用真實任務做小規模 A/B test,再決定哪些工作切換、哪些工作保留原模型。資安團隊若符合 Fairwind 資格,可以申請 Cyber 版本進行隔離測試,但不應跳過 patch 驗證與人工審查。

資料來源