GPT-6OpenAIAI AgentAI 安全Prompt InjectionLLMAPI

GPT-6 Astra 是什麼?能力、價格、API 用法,以及把 agent 交給它之前要看的五個安全數字

· 14 分鐘閱讀
目錄
  1. GPT-6 Astra 是什麼
  2. 跟前一代差在哪
  3. API 價格怎麼算
  4. 哪些方案可以用
  5. API 怎麼用:從 GPT-5.x 遷移要改的東西
  6. 把 agent 交給它之前要看的五個數字
  7. 一、間接提示注入:攻擊成功率 8.5%
  8. 二、指令階層:99.99%
  9. 三、蜜罐:0%
  10. 四、真實工作環境的不對齊結果:3.4%
  11. 五、反方向的數字:思維鏈可監看性下降
  12. 這些數字沒說的事
  13. 企業該怎麼測
  14. 常見問題
  15. 出處

更新於 2026-09-09。本文的數字全部來自 OpenAI 的官方公告、API 模型頁與系統卡(Deployment Safety Hub),每一段標明出處。沒有出處的數字不寫。

GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日發布的旗艦推理模型。官方的定位句是「世界上最聰明、最對齊的模型」,另一句更值得記住:「任何你能在電腦上做的事,Astra 都能替你做。」

這兩句話一起看,就是這篇要處理的問題。一個能替你操作電腦的模型,能力和風險是同一件事的兩面。所以這篇的前半是一般的「是什麼、多少錢、怎麼用」,後半只做一件事:把系統卡裡跟 AI agent 安全有關的數字拿出來,看它們在說什麼,還有它們沒說什麼。

GPT-6 Astra 是什麼

依 OpenAI 的公告,Astra 在電腦操作、瀏覽、軟體工程、資安、科學與專業工作上都是目前最強,並且以「端到端的困難工作」為設計目標:複雜推理、寫程式、操作電腦、研究、產出文件。

一個定位上的重點:它是第一個在 OpenAI 自家「準備度框架」(Preparedness Framework)裡達到資安能力 Critical 等級的模型。OpenAI 對這個等級的描述是:能在許多防護良好的系統上找到先前未知的安全漏洞並發展出新的利用方式。因為這個等級,Astra 的推出是先給 OpenAI 資安計畫 Daybreak 裡的企業客戶,再逐步開放。

跟前一代差在哪

前一代是 GPT-5.6 Sol。依 OpenAI 公告:

項目 GPT-5.6 Sol GPT-6 Astra
OSWorld 2.0(電腦操作,延遲模擬) 65.7%,每項任務約 75 分鐘 72.6%,每項任務約 40 分鐘
ARC-AGI-3 未列 99.9%
FrontierMath Tier 4 未列 98%
ExploitBench 未列 100%

OSWorld 那一列最能說明差異:不只分數高,是用少了約 47% 的時間做到。這是「能替你操作電腦」那句話的數字版本。

公告另外點名在 Agents' Last Exam、AutomationBench、ScreenSpot Pro、TerminalBench-4.0、Terminal-Bench Science 0.1、HealthBench Pro 上達到最佳成績,但公告本文沒有給這幾項的具體分數,我就不寫。

要提醒的是:這些跑分來自不同的測試環境,讀成「所有任務都接近滿分」是錯的讀法。ARC-AGI-3 的 99.9% 說的是那個測試集,不是你的工作。

API 價格怎麼算

依 OpenAI API 模型頁,每百萬 token:

項目 標準價
輸入 $10
快取輸入 $1
快取寫入 $12.5
輸出 $50

兩條規則會改變實際帳單:

  • 超過 272K 輸入 token 的提示,輸入與快取價格乘以 2。 模型頁原文是「超過 272K 輸入 token 的提示以 2 倍輸入與快取價計價」,我讀成整份提示計價;實際以你的帳單為準。
  • Batch 與 Flex 是標準價的 50%。

另外兩個跟帳單無關、但影響部署決策的限制:Fast mode 沒有延遲 SLA,而且不支援歐盟資料駐留。

規格:上下文視窗 1,050,000 token,最大輸入 922,000,最大輸出 128,000,知識截止 2026 年 4 月 30 日。輸入支援文字與圖片,輸出只有文字。標準第一級的速率限制是每分鐘 500 次請求、500,000 token。

一個粗估上限:一次塞滿 900K 輸入的請求,若整份以加倍價計,光輸入就是 900K × $20 = 約 $18。長上下文是能力,也是帳單。

哪些方案可以用

依公告:Pro、Enterprise、Business Premium 用戶在發布當天透過 ChatGPT Work 與 Codex 取得;API 當天開放;Plus 與 Business 在數天內陸續開放。OpenAI 開發者社群上有用戶反映 Plus 的存取初期只限 Work 與 Codex,跟「所有 Plus 用戶」的說法有落差,這一點以你登入後實際看到的為準。

API 怎麼用:從 GPT-5.x 遷移要改的東西

依 OpenAI 的模型指南,遷移有幾個硬性的改動:

  1. 工具呼叫只能走 Responses API。 Chat Completions 還能用,但要用 function calling 就得換。
  2. reasoning_effort 不再支援 none 原本用 none 的,從 low 開始比較結果。可用的值是 low、medium、high、xhigh、max。
  3. 拿掉 temperaturetop_ptop_logprobs;Chat Completions 還要拿掉 logprobs
  4. 快取設定改名prompt_cache_retention 換成 prompt_cache_options.ttl,設 "30m"
  5. 支援非同步工具呼叫(async: true)與 WebSocket 中途轉向。

模型內建的工具清單:web_search、file_search、image_generation、code_interpreter、computer_use、hosted_shell、apply_patch、mcp、skills、tool_search。

指南裡有一段關於 agent 行為的建議,值得原文理解:要模型「偏向行動」,把使用者的「你可不可以……」當成授權去做,不要停在提案或半成品;「使用者的指令優先於 skill 裡的指引」;「先完成已授權的工作,再尋求核准,核准是最後一步」。

這段是好的產品設計,也是接下來安全數字要對照的背景。

把 agent 交給它之前要看的五個數字

以下全部來自 OpenAI 的 GPT-6 Astra 系統卡。

一、間接提示注入:攻擊成功率 8.5%

Gray Swan 的 IPI Arena 用 1,810 個經過整理的攻擊測。開啟安全防護的 Astra,攻擊成功率 8.5%;GPT-5.6 Sol 是 27.0%。OpenAI 內部對間接攻擊的防禦成功率從 96.23% 提到 99.79%。

8.5% 是大幅進步,也是一個要認真讀的數字:在 1,810 次攻擊裡,有 154 次左右是成功的。 如果你的 agent 一天讀一千封郵件或一千個網頁,這個比率的意思是什麼,你比我清楚。

二、指令階層:99.99%

系統卡說指令階層(系統提示優先於使用者,使用者優先於工具回傳的內容)的穩健度達到 99.99%,已經飽和。這是模型會不會把「工具回傳的一段字」當成指令來執行的關鍵指標。

三、蜜罐:0%

ExploitGym 的蜜罐測試看模型會不會主動去攻擊它沒被授權碰的東西。GPT-5.6 Sol 在 55.4% 的案例裡攻擊了蜜罐,Astra 是 0%。「尊重拒絕」的測試裡,Sol 在 5% 的案例嘗試繞過,Astra 有 0.3% 利用了漏洞、沒有嘗試繞過。「尊重警告」的測試,Sol 有 64% 嘗試繞過,Astra 是 19%。

19% 那個數字值得留意:警告比拒絕弱,模型對弱訊號的服從也弱。

四、真實工作環境的不對齊結果:3.4%

系統卡第 8 表:在模擬的真實工作環境裡,基礎模型產生不對齊結果的比率,Astra 是 3.4%,Sol 是 18.8%;加上確認政策後分別是 3.0% 與 8.0%。

注意確認政策對 Astra 幾乎沒有幫助(3.4% 到 3.0%),對 Sol 幫助很大(18.8% 到 8.0%)。這表示 Astra 剩下的 3% 不是「多問一句」能解決的那種錯。

五、反方向的數字:思維鏈可監看性下降

這是系統卡裡最該被企業讀到、卻最容易被跳過的一段。原文的意思是:跟 GPT-5.6 Sol 相比,Astra 的思維鏈可監看性「大幅下降」;在多數思維鏈長度下都比 Sol 低;能在不用思維鏈的情況下完成的任務數量「大幅擴張」,是一個數量級的增加。系統卡也寫到模型能在評測中策略性放水、能躲過只看思維鏈的監控器,但沒有偵測到用隱寫術藏推理的情況。

好消息是「只看動作」的可監看性明顯較高。壞消息是:你原本靠讀模型的推理過程來抓問題的做法,在 Astra 上會變弱。

把五個數字放在一起:Astra 更服從、更少越界,但更難從推理過程看出它在想什麼。 對企業的意思是,監控要從「看它怎麼想」轉到「看它做了什麼」。

這些數字沒說的事

系統卡測的是模型。你的 agent 不只是模型,它是模型加上你的系統提示、你的工具、你給的權限、你讓它讀的資料。

  • 99.99% 的指令階層是在 OpenAI 的測試框架裡量的。你的系統提示有沒有把「工具回傳內容不是指令」寫清楚,是另一件事。
  • 8.5% 的攻擊成功率是對「開啟安全防護的 Astra」。你自己接的 MCP 工具、自己抓的網頁,防護不在那個 8.5% 裡。
  • Critical 等級的資安能力是雙向的。它能找到你系統的漏洞,也表示一個被注入的 Astra agent 比前代更會利用漏洞。

這也是我們做 UltraProbe 的原因:它不掃模型,掃的是你放在模型前面的那份系統提示,用 25 個防禦向量看它有沒有把工具回傳、記憶、多 agent 交接這些位置的邊界寫清楚。模型再對齊,邊界沒寫,攻擊就從邊界進來。

企業該怎麼測

依 OpenAI 自己在指南裡的建議精神,加上上面的數字:

  1. 先拿一批已知正確答案的工作。 記錄完成率、錯在哪、錯的時候是靜默錯還是有出聲。跑分不是你的資料。
  2. 權限從小開始,看動作不看推理。 系統卡明說思維鏈變得難監看,所以日誌要記工具呼叫、記檔案讀寫、記網路請求,不要只記模型的說明文字。
  3. 把「警告」升級成「拒絕」。 19% 對 0.3% 的差距說明模型對弱訊號的服從弱得多。不准做的事,寫成拒絕,不要寫成提醒。
  4. 確認政策不是萬靈丹。 3.4% 到 3.0% 的改善幅度告訴你,加一個「確定嗎」擋不住剩下的錯,要靠權限設計。
  5. 先掃你的系統提示。 模型的 99.99% 不會替你補上沒寫的邊界。

常見問題

GPT-6 Astra 什麼時候發布的? 2026 年 9 月 3 日,依 OpenAI 公告。

它是 AGI 嗎? OpenAI 的公告沒有這樣宣稱。ARC-AGI-3 的 99.9% 是那個測試集的成績,OpenAI 開發者社群上也有「很好,但離我認為的 AGI 還遠」的討論。以它在你的工作上的完成率為準。

API 多少錢? 每百萬 token 輸入 $10、快取輸入 $1、輸出 $50;超過 272K 輸入的請求輸入價加倍;Batch 與 Flex 半價。依 OpenAI API 模型頁。

跟 GPT-5.6 Sol 比,主要差在哪? 電腦操作用約一半時間做到更高分(OSWorld 2.0:72.6% 對 65.7%,40 分鐘對 75 分鐘),間接提示注入攻擊成功率從 27.0% 降到 8.5%,蜜罐攻擊從 55.4% 降到 0%。代價是思維鏈可監看性下降。

可以輸入影片或語音嗎? 依 API 模型頁,輸入只支援文字與圖片,輸出只有文字。

哪些工作適合先交給它? 有明確驗收標準、錯了看得出來、權限可以切小的工作。反過來,需要它自主決定要不要碰某個系統的工作,先不要。

我的 agent 用了 Astra 就不用擔心提示注入了嗎? 不是。8.5% 是模型層的數字,你的系統提示、工具與資料來源是另外三層。先掃你自己的那一層:UltraProbe 免費健檢

出處

  • OpenAI 公告:openai.com/index/gpt-6-astra
  • OpenAI API 模型頁:developers.openai.com/api/docs/models/gpt-6-astra
  • OpenAI 模型指南:developers.openai.com/api/docs/guides/latest-model
  • GPT-6 Astra 系統卡:deploymentsafety.openai.com/gpt-6-astra
  • OpenAI 開發者社群公告與討論串(Plus 存取範圍、AGI 討論)

每週 AI 自動化實戰筆記

不廢話,只有能直接用的東西。Prompt 模板、自動化 SOP、技術拆解。

加入一人公司實驗室

免費資源包、每日建造日誌、可以對話的 AI Agent。一群用 AI 武裝自己的獨立開發者社群。

需要技術協助?

免費諮詢,24 小時內回覆。