OpenAI 發布 GPT-6 Astra:AGI 時代已經到來,企業搶先看

OpenAI 發布 GPT-6 Astra:AGI 時代已經到來,企業搶先看

OpenAI 於 2026 年 9 月 3 日推出 GPT-6 Astra,並稱它是最聰明、也最能照使用者意圖行事的模型。企業評估升級時,可先比較使用管道、費用與任務表現。Astra 牌價是 GPT-5.6 Sol 目前促銷價的 2.5 倍;在第三方最高強度評測中,寫程式代理每筆成本與 Sol 接近,綜合智慧評測的每筆成本則高約 75%。是否值得升級,仍要以企業的實際工作測試為準。

30 秒看結論

  • 使用管道:API 與 Microsoft Foundry 已開放;ChatGPT 分批推出,Plus 只在 Work 與 Codex;Amazon Bedrock 尚未上架
  • 成本評估:每百萬 token 輸入 $10、輸出 $50,是 GPT-5.6 Sol 目前促銷價的 2.5 倍;在第三方寫程式代理評測的最高強度設定下,token 用量約為 Sol 的三分之一,每筆成本與 Sol 相當
  • 能力提升:流程自動化、終端機任務與資料庫遷移明顯進步;未加產品防護時的越權率從 Sol 的 48% 降到 Astra 的 0%,官方內部幻覺測試從 12.2% 降到 4.2%
  • 評測限制:Artificial Analysis 綜合智慧指數與上一代接近,仍低於 Claude Fable 5.1;知識工作評測有進有退

OpenAI 講的 AGI 是什麼

官方發表文對 GPT-6 Astra 的定位是「世界上最聰明也最對齊的模型」,意思是它更能照使用者的意圖行事、不超出被授權的範圍。

OpenAI 總裁 Greg Brockman 講得更直接,他稱這是世代級的跳躍,並說這一代有一天可能會被視為通用人工智慧(AGI)的到來。

AGI 指的是能高度自主運作、並在多數具有經濟價值的工作上超越人類的系統,這是 OpenAI 自己在章程裡下的定義。這個門檻涵蓋的工作範圍很廣,遠超過單一評測能回答的範圍。

對企業而言,導入評估可分成三個面向:使用管道、成本結構,以及模型在實際工作中的能力表現。

GPT-6 Astra 在不同工作類型下的成本差異示意

使用管道:GPT-6 Astra 的開放範圍

OpenAI 在 9 月 3 日發表時採分批開放。到 9 月 7 日為止,四個管道的進度並不一致。

管道9 月 7 日的狀態
OpenAI API已開放,可直接透過 API 呼叫
Microsoft Foundry已上架
ChatGPT分批開放;Plus 僅限 ChatGPT Work 與 Codex
Amazon Bedrock尚未上架

ChatGPT 裡的名稱是 GPT-6 Pro,開放給 Pro、Business 與 Enterprise,Plus 方案只在 ChatGPT Work 與 Codex 用得到。

Microsoft Foundry 的 Global Standard 已可在美洲、歐洲、亞太與中東非洲四區部署。若企業要求資料處理限制在特定區域,目前只有美洲 Data Zone 提供此模型。

Astra 單次可處理 1,050,000 個 token 的輸入與對話資訊,最多輸出 128,000 個 token,知識截止在 2026 年 4 月 30 日。

需要引用近期法規或市場資料的流程,仍要連接可靠的外部資料來源,不能只靠模型的內建知識。

成本評估:牌價與單次任務成本

Astra 的輸入與輸出牌價,均為 Sol 目前促銷價的 2.5 倍。

項目(每百萬 token)GPT-6 AstraGPT-5.6 Sol
輸入$10.00$4.00
輸出$50.00$20.00
重複輸入的快取讀取$1.00$0.40

Sol 目前的 $4 與 $20 是促銷價,官方定價頁寫明這個價格「至少維持到 2026 年 11 月 21 日」。編列後續預算時,需要區分促銷期間的價差與常態費率。另外,超過 272K token 的長請求,整筆費率會提高。API 計費的完整結構整理在OpenAI API 費用怎麼算

單次任務成本需連同 token 用量評估

牌價較高,不代表每筆任務一定更貴;如果模型能以更少的 token 完成工作,仍可能抵銷部分價差。Artificial Analysis 的結果顯示,寫程式代理與綜合智慧評測呈現不同的成本曲線。

寫程式代理評測(最高強度設定)GPT-6 Astra
(Codex)
GPT-5.6 Sol
(Codex)
Claude Fable 5.1
(Claude Code)
寫程式代理指數676570
每筆 API 成本$4.72$5.00$9.18
每筆 token 用量404 萬1,317 萬714 萬
每筆耗時26.8 分鐘10.2 分鐘24.0 分鐘

寫程式代理是能使用工具、連續完成程式開發任務的 AI 代理。Astra 的成本能與 Sol 打平,靠的是 token 用量降到三分之一以下;代價是它花的時間是 Sol 的 2.6 倍。

Fable 5.1 的分數最高,但每筆成本接近 Astra 的兩倍,多付的那一倍換到 3 分。Artificial Analysis 的結論也是 Astra 領先這項評測的成本效率。

在綜合智慧指數評測中,Astra 的輸出 token 雖比 Sol 少約一成,每筆成本仍高約 75%。

因此,寫程式代理的成本結果不能直接套用到其他工作。

能力比較:代理型任務與綜合智慧表現

Astra 的優勢主要出現在流程自動化、終端機與資料庫遷移等代理型任務;綜合智慧與知識工作評測的結果則較不一致。

官方發表文列出九張對照表,涵蓋專業工作、程式、電腦操作、科學與資安。以下節錄與企業應用較相關的專業工作與程式評測。

OpenAI 官方公布的專業工作模型跑分對照表
圖:OpenAI 官方發表文的專業工作對照表,2026 年 9 月 7 日查閱。原表另有 Claude Fable 5 與 Gemini 3.8 Flash 兩欄,此處省略。最後一列的綜合智慧指數由第三方機構 Artificial Analysis 提供。
OpenAI 官方公布的程式類模型跑分對照表
圖:OpenAI 官方發表文的程式對照表,2026 年 9 月 7 日查閱。原表另有 Claude Fable 5 與 Gemini 3.8 Flash 兩欄,此處省略。

官方與第三方公布的項目很多,下面挑出與企業工作關係較直接的六項:

測試項目GPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
AutomationBench(流程自動化)41.4%18.1%31.4%26.9%
Terminal-Bench 4.0(終端機任務)57.9%37.3%55.8%52.6%
Internal Database Migration Tasks(資料庫遷移任務)63.9%42.7%57.8%
DeepSWE v1.1(軟體工程)74.1%72.7%67.4%73.7%
BrowseComp(網頁檢索)91.5%90.4%90.8%
Artificial Analysis 綜合智慧指數61.260.965.763.1

代理型任務進步明顯,資安風險控管也更嚴格

流程自動化、終端機任務與資料庫遷移的成績,比上一代高 20 個百分點以上。

OpenAI 也表示,Astra 在資安能力評估中達到最高風險門檻,因此增加了防護措施。在未加產品防護的測試中,Sol 的越權率為 48%,Astra 為 0%;官方內部幻覺測試則從 12.2% 降到 4.2%。

綜合智慧未領先,程式能力視評測而定

在 Artificial Analysis 綜合智慧指數中,Astra 得分低於 Claude Fable 5.1Claude Opus 5,與上一代 Sol 僅差 0.3 分。

在 DeepSWE 軟體工程評測中,Astra 領先 Claude Fable 5.1 近 7 個百分點,與 Claude Opus 5、Gemini 3.8 Flash 則相差不到 0.5 個百分點。

三家模型在企業情境下的導入差異,可參考〈OpenAI vs Claude vs Gemini:企業 API 選型比較〉。

評測解讀:不同測試結果應分開判讀

不同評測的任務、工具環境與計分方式不同。以下幾組數字需要分開解讀。

  • 幻覺率大幅降低:除前述官方內部測試外,Artificial Analysis 的獨立測試也從 92% 降至 51%。
  • 長文件的檢索與推理:官方測試著重資訊檢索,結果明顯提升;第三方測試著重閱讀完整文件後的推理,分數下降 2 至 3 分。
  • 寫程式代理的成本比較跨越不同工具環境:Astra 使用 Codex,Claude 系列使用 Claude Code,因此只能作為方向性參考,不能視為控制其他變因後的模型比較。

哪些工作值得現在就安排比較測試?

我們建議優先測試寫程式代理;軟體介面操作與程式碼安全工作,則依實際需求安排驗證。

  • 寫程式代理:第三方評測同時顯示能力與成本效益,是三類工作中最適合優先驗證的項目。
  • 軟體介面操作:官方評測顯示能力提升,仍應以企業自己的流程量測成功率、耗時與成本。
  • 程式碼安全工作:可先測試安全審查與修補;進階用途需先確認模型權限、功能與控管措施是否開放。

如果目前工作以知識問答為主,且既有模型已符合品質要求,可暫時維持現有模型。綜合智慧指數與公開費用只能作為參考,無法直接推估企業在摘要、翻譯或客服流程中的實際效益。

結論

GPT-6 Astra 在流程自動化、終端機與資料庫遷移等任務上的提升,已值得企業安排測試。建議先從寫程式代理開始;知識問答等既有流程若已符合需求,暫時不必升級。

測試時,應以同一批實際任務比較完成品質、總成本、耗時與人工介入次數,再決定是否導入。若需要規劃 OpenAI API 的導入方式、雲端採購與帳務路徑,可參考〈OpenAI API 企業怎麼用〉。

資料來源

AI 模型 OpenAI OpenAI API