Gemini 3.8 Flash 登場:金融分析贏過 Opus 5,但價格沒漲

Gemini 3.8 Flash 登場:金融分析贏過 Opus 5,但價格沒漲

Google 於 9 月 2 日發表 Gemini 3.8 Flash,牌價維持不變;在金融分析與複雜法律流程測試中,3.8 Flash 的測試分數高於 Claude Opus 5。本文整理升級幅度、適合優先測試的工作負載,以及換版前的限制。

30 秒看結論

  • 價格維持不變:Gemini 3.8 Flash 的 input $0.75、output $3.75(每百萬 token)與 3.7 Flash 相同,現行牌價適用至 2026 年 12 月 31 日
  • 部分代理類測試分數高於旗艦:金融分析 61.4% 對 58.6%、法律流程 10.0% 對 6.7%,兩項都高於 Claude Opus 5;DeepSWE 也從 65.3% 升至 73.7%。Claude Opus 5 的標準層牌價約為 Gemini 3.8 Flash 的 6.7 倍。
  • 3.7 Flash 使用者建議升級到 3.8:牌價與 API 介面相同;替換模型名稱並完成結構化輸出、工具呼叫與延遲驗收後,再切換正式流量
  • 中推理較適合作為預設:3.8 Flash 中推理每筆成本為 $0.41,與 3.7 Flash 高推理的 $0.40 接近,但指數較高(57 對 56)。3.8 Flash 高推理成本會增至 $0.58,適合只在需要長鏈推理時使用。

這次升級了什麼:進步集中在長流程與代理任務

Google 於 2026 年 9 月 2 日發表 Gemini 3.8 Flash,官方將它定位為 Flash 系列目前能力最強的主力模型,主要提升長流程軟體工程與自主代理能力。這是 Flash 系列六週內的第三個版本;前兩版為 Gemini 3.6 FlashGemini 3.7 Flash

官方發表文附上一張跨廠商對照表,比較兩代 Flash 與 Anthropic、OpenAI 的同期模型,涵蓋 15 項測試與牌價:

Google 官方公布的 Gemini 3.8 Flash 跨廠商跑分對照表,比較兩代 Flash 與 Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 的輸入輸出牌價與 15 項測試成績

圖片來源:Google 官方發表文(2026 年 9 月 3 日查閱)。價格欄括號內是 2027 年起的牌價。

與 3.7 Flash 相比,下列五項測試分數都有上升:

測試項目Gemini 3.8 FlashGemini 3.7 FlashClaude Opus 5
DeepSWE v1.1(長流程軟體工程)73.7%65.3%74.0%
Vals Finance Agent v2(金融分析代理)61.4%59.0%58.6%
Harvey Legal Agent(複雜法律流程)10.0%8.8%6.7%
Terminal-bench 2.1(終端機程式代理)89.4%85.8%89.1%
CharXiv Reasoning(複雜圖表資訊整合)86.2%84.5%83.7%

Opus 5 仍在三項測試明顯領先:通用代理為 51.8% 對 19.1%、電腦操作為 75.4% 對 59.0%、知識工作(GDPVal-AA v2,Elo 分數)為 1824 對 1545。

Google 的表格屬於供應商自選比較,Glean 的結果也來自內部評測。Glean 表示,3.8 Flash 在長時間、文件量大的流程中,完成任務數為 3.7 Flash 的三倍以上。這兩組資料足以用來排定測試與換版順序,但不能外推到表中未涵蓋的工作負載。

3.8 Flash 的輸入與輸出上限和 3.7 Flash 相同:輸入 100 萬 token、輸出 6.4 萬 token,並支援多模態輸入、函式呼叫、搜尋與電腦操作,目前已正式推出(GA)。同時發布的 3.8 Flash Cyber 採限定開放;上一代 Cyber 版本也是如此,一般企業無法直接申請。

Gemini 3.8 Flash 價格未調整但能力提升的示意

Token 牌價與 3.7 Flash 相同,2027 年起兩代同步翻倍

標準層牌價(每百萬 token)InputOutput
3.8 Flash(至 2026/12/31)$0.75$3.75
3.7 Flash(至 2026/12/31)$0.75$3.75
兩者(2027/1/1 起)$1.50$7.50

若工作流程有使用快取或批次處理,現行快取讀取牌價為 $0.075,批次 input/output 牌價為 $0.375/$1.875;2027 年起也會同步翻倍。

現行導入價只到 2026 年 12 月 31 日;若使用量不變,直接沿用這組數字編列 2027 年預算,實際成本會是預估值的兩倍。

高推理下的單筆成本高四成:推理強度該怎麼設

官方模型卡提醒,高推理設定可能增加 token 用量。Artificial Analysis 在自家任務組測得,3.8 Flash 高推理的平均成本為 $0.58,較 3.7 Flash 高推理的 $0.40 約高四成;平均輸出量增加三成至 4.8 萬 token,代理評測的執行回合也更多。

Artificial Analysis 對三種推理強度的量測如下:

推理強度3.8 Flash 每筆成本3.7 Flash 每筆成本Intelligence Index(3.8/3.7,非百分制)
$0.58$0.4059/56
$0.41$0.2657/53
$0.24$0.1652/51

上表為 Artificial Analysis 在自家 Intelligence Index 任務組的量測,換到別的工作負載數字會變,但三個級距之間的落差足以當設定的依據。

建議以中推理強度作為預設。 在這組評測中,3.8 Flash 中推理每筆 $0.41,接近 3.7 Flash 高推理的 $0.40;Intelligence Index 則為 57 對 56。高推理留給確實需要長鏈推理的流程,因為每筆成本會由 $0.41 增至 $0.58,約多四成。

企業該不該換:兩種情況要分開看

情況一:已使用 3.7 Flash。建議升級到 3.8 Flash。 牌價與 API 介面不變;替換模型名稱並完成結構化輸出、工具呼叫與延遲驗收後,即可切換正式流量。

情況二:旗艦模型正在處理多步驟專業流程。建議先分流金融分析、法律流程與工具呼叫密集的工作。 金融與法律跑分中,3.8 Flash 均高於 Claude Opus 5,而 Opus 5 的標準層牌價約為 3.8 Flash 的 6.7 倍。Artificial Analysis 也測得,3.8 Flash 在工具使用類測試比 3.7 Flash 高 12 個百分點。

對回覆時間敏感的即時互動,不建議預設高推理。 Artificial Analysis 測得,3.8 Flash 高推理的每筆任務時間為 2.5 分鐘,高於 3.7 Flash 高推理的 2.2 分鐘。

跨廠商選型與整體用量優化,可分別參考〈OpenAI vs Claude vs Gemini:企業 API 選型比較〉與〈AI API 成本怎麼省〉。

為什麼 Google 六週內推三版

Artificial Analysis 統計,這是 Google 四個月內推出的第四個 Flash 模型。

我們的判斷是,Google 正在用更高的能力守住 Flash 價格帶。 3.8 Flash 的現行 input/output 牌價維持在 $0.75/$3.75;在金融、法律與部分代理測試中,分數已接近或超過旗艦模型。企業可用遠低於 Opus 5 的牌價處理這些工作,但 Flash 四個月內已更新四次,導入架構不宜把模型版本寫死。

結論

已使用 3.7 Flash 的企業,建議升到 3.8 並以中推理為預設。若要從旗艦模型分流,先移金融、法務與工具呼叫密集的工作;純知識工作留在旗艦,對延遲敏感的即時互動則避免使用高推理。

若你正在評估 Gemini 的導入,或想重新試算換版之後的成本結構,歡迎與我們的解決方案團隊討論。

資料來源

AI 模型 API 成本 Gemini