技術指南
GPT-6 API 指南:Astra 定價、上下文、工具與遷移

在 OpenAI Responses API 中指定 gpt-6-astra,即可使用 GPT-6 建置應用程式。 該模型支援文字和圖片輸入、文字輸出、函式呼叫、Structured Outputs、串流回應以及 OpenAI 代管工具。上下文視窗為 1,050,000 token,最大輸出為 128,000 token;Standard 模式每百萬輸入 token 10 美元,每百萬輸出 token 50 美元。
正式環境遷移不能只改模型名稱。GPT-6 新增了非同步工具呼叫、回合內引導和工作階段中調整推理設定。這些能力會影響工作階段狀態、待處理呼叫、取消、可觀測性和成本。應先固定評估集,再將少量任務分配給新模型試執行。
來源: 模型頁面; 模型指南; Responses API 遷移指南; 發布公告; 安全概覽; Artificial Analysis; API 成本與推理強度實測; 源自實際專案任務的程式開發測試。核對日期:2026 年 9 月 7 日。
參數速查
| 設定 | 目前值 |
|---|---|
| 模型 ID | gpt-6-astra |
| 推薦 API | Responses API |
| 上下文視窗 | 1,050,000 token |
| 最大輸出 | 128,000 token |
| 知識截止日期 | 2026 年 4 月 30 日 |
| 推理強度 | low、medium、high、xhigh、max |
| 文字 | 支援輸入和輸出 |
| 圖片 | 僅支援輸入 |
| 音訊和影片模態 | 不直接支援 |
| 函式呼叫 | 支援 |
| Structured Outputs | 支援 |
| 微調 | 不支援 |
| 免費 API 層級 | 不支援 |
第三方 API 測試發現了什麼
早期測試最明確的啟示是:模型設定與模型名稱同樣重要。
Artificial Analysis 透過 OpenAI 官方 API 測試了 Astra max。目前快照中,其智慧指數為 55,輸出速度為每秒 64.3 token,每項指數任務成本為 2.57 美元,最高推理強度下首次輸出 token 的等待約為 355 秒。Max 本就是刻意採用的高成本設定,但這些資料說明,API 整合必須讓推理強度、延遲和成本可見,不能僅用一個 gpt-6-astra 標籤概括體驗。
ComputingForGeeks 用實際請求核對了公佈的 token 費率,再讓不同模型及推理強度處理同一除錯問題。其模型對比中,Astra 使用 3,525 個推理 token,所需時間 75.5 秒,成本約 0.194 美元;Sol 所需時間 39.3 秒,成本約 0.048 美元。兩者診斷相同,但 Astra 補充了限制說明和更充分的確認步驟。
評測者還報告,對同一個 Astra 問題從 low 升到 max 後,成本增加到接近 10 倍,延遲約為 8 倍。Low 已經找出三個原因;更高強度提供了更詳細的方案,並最終觸及評測者設定的 6,000 token 輸出上限。這只是一次測試,但佐證了較穩健的預設策略:從 medium 開始,有量測依據時再提高強度,並設定輸出上限。
源自實際專案任務的程式開發測試展示了另一面:便宜模型雖然通過測試,卻交付了跨元件狀態錯誤,而 Astra 避免了該問題。單次 API 呼叫可能更貴,但算上審核與修正後,完成合格任務的總成本反而更低。評估需要同時記錄這兩個數字。
模型頁面還列出了 Responses API 支援的網頁搜尋、檔案搜尋、圖片產生、程式碼解釋器、代管 shell、套用修補程式、skills、電腦操作、MCP 和工具搜尋。支援某個工具並不意味著它已自動啟用、獲得授權或適合你的應用程式。
創作者演示不能證明哪些 API 能力
Matt Shumer 的體驗文章表示,他最大的實驗依賴工作階段協調和大量 token,長時間執行也可能陷入停滯。因此,整合應用程式除了記錄所需時間,還應量測距離驗收目標是否更近。一個仍在產生輸出的執行程序,可能已經不再改善交付成果。
Claire Vo 的節目筆記在實作之外強調了瀏覽器 QA。對 API 應用,相應的問題是執行環境能否檢查完成後的成果。程式碼任務需要行為驗收,文件任務需要來源檢查;只有模型文字輸出,無法重現依賴豐富工具的演示。
這些體驗有助於設計測試,但不能驗證 API 參數、計費行為或普遍完成率。
最小 Responses API 請求
使用目前快速入門推薦的官方 OpenAI SDK 版本。最小 JavaScript 請求結構如下:
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-6-astra",
reasoning: { effort: "medium" },
input: [
{
role: "developer",
content: "Return a concise, source-grounded decision brief.",
},
{
role: "user",
content: "Compare the attached proposals against the approval criteria.",
},
],
});
console.log(response.output_text);API 金鑰應放在環境管理的金鑰設定中,不能寫進提示詞、原始碼、用戶端程式碼或紀錄。應驗證實際回應物件,不能假定 output_text 是唯一輸出,因為回應中還可能出現工具呼叫和結構化項目。
有目的地選擇推理強度
GPT-6 Astra 不支援 none。評估時從 low 或 medium 開始,只有品質提升足以抵消延遲和成本時才提高強度。OpenAI 的評估表報告各推理強度中的最高分,因此宣傳中的基準得分並不保證在你選擇的設定下也能達到。
可參考以下任務分配策略:
| 任務信號 | 起始強度 |
|---|---|
| 簡短、邊界明確的轉換 | Low |
| 有明確標準的多來源分析 | Medium |
| 困難的規劃、程式開發或工具協調 | High |
| 低強度失敗後的少見高價值問題 | Xhigh 或 max |
每次執行都應記錄推理強度。否則,後續表現退步可能看似模型變化,實際只是設定變了。還應設定最大輸出預算:隱藏推理按輸出計費,高強度執行可能在可見答案完成前就產生大量費用。
在工作階段中調整推理
OpenAI 文件介紹了 configuration_update 輸入項,可在保留快取提示詞前綴的同時更改推理強度。當簡單工作階段遇到複雜異常,或複雜階段結束後轉入一般後續工作時,這很有用。
應用程式應記錄設定變更時間軸,而不只是最後的設定。從 low 升到 max 的執行,與始終保持 low 的執行,其預期延遲和成本不同。
非同步工具呼叫
使用非同步函式或自訂工具時,應用程式執行呼叫期間,Astra 可以繼續處理不依賴該結果的工作。結果就緒後,透過原始呼叫 ID 回傳。
非同步執行會引入常見的分散式系統問題:
- 使用者取消或修改任務後,結果才回傳。
- 兩個呼叫可能以不同於發出順序的次序完成。
- 外部寫入已成功,但請求仍發生逾時。
- 重試非冪等呼叫可能重複執行操作。
- 所有獨立工作都已完成,但必需呼叫仍待處理。
持續儲存包含 pending、completed、failed、cancelled 和 expired 狀態的狀態機。寫操作使用冪等鍵;重試前查詢權威系統;拒絕屬於過期任務版本的延遲結果。
回合內引導
透過 WebSocket 連接,應用可在 Astra 工作時發送新的使用者指令。這讓長任務無需重啓就能糾正,但也要求對使用者意圖進行版本管理。
每次方向調整都應記錄時間戳,並標記哪些待處理操作因此失效。如果使用者改變報告受眾,起草工作可以繼續;如果使用者改變外部操作的帳號或目標位置,應先暫停,直到新範圍得到驗證和批准。
結構化輸出與工具
下游程式碼需要固定結構時,使用 Structured Outputs。結構驗證只能保證形狀,不能保證事實正確。接受對象前,應核對識別碼是否屬於允許值、獨立計算總數,並驗證引用來源。
設計職責明確的工具:
優先:create_draft_invoice(customer_id, line_items)
避免:run_shell(command)
優先:search_approved_project_sources(query, project_id)
避免:browse_any_url(url)身份、租戶範圍、允許參數、預算和確認必須由應用程式執行,不能只依賴提示詞。連接正式系統前,請閱讀 AI Agent 架構指南。
電腦操作
按 OpenAI 報告,GPT-6 Astra 是其電腦操作能力最強的模型,但視覺介面並非確定性環境,觀察與操作之間可能發生變化。應將點擊和按鍵視為擬執行操作:
- 限定可用應用、帳號和任務範圍。
- 儲存決策所依據的介面狀態。
- 執行重要變更前展示預覽。
- 發送、刪除、發布、購買或權限修改前要求確認。
- 獨立讀取並驗證操作後的狀態。
- 保留足夠證據,以便診斷和撤銷失敗操作。
桌面 AI Agent 指南介紹了本地計算機存取如何改變風險模型。
GPT-6 API 定價
OpenAI 列出的 GPT-6 Astra 每百萬文字 token 費率如下:
| 計費項 | Standard 費率 |
|---|---|
| 輸入 | 10.00 美元 |
| 快取輸入 | 1.00 美元 |
| 快取寫入 | 12.50 美元 |
| 輸出 | 50.00 美元 |
輸入超過 272,000 token 時,整個請求的輸入及快取費率為兩倍,輸出費率為 1.5 倍。快取寫入為未快取輸入費率的 1.25 倍。Batch 和 Flex 為 Standard 的 50%;Fast 模式為適用價格的兩倍。工具呼叫可能另行收費。

CodeRabbit 依固定 token 數量及 2026 年 9 月 4 日費率製作的成本示意,並非完成任務的實測費用。
成本示例
一個包含 80,000 個未快取輸入 token 和 8,000 個輸出 token 的 Standard 請求,費用約為:
輸入:80,000 / 1,000,000 x $10 = $0.80
輸出:8,000 / 1,000,000 x $50 = $0.40
模型費用小計:$1.20該示例不含工具、快取寫入、重試和審核。超過長提示詞閾值後,前述倍數會作用於整個請求的計費。
合理使用提示詞快取
將穩定指令、結構定義和共享來源放在經常變化的使用者內容之前,讓請求可以重複使用共同前綴。分別記錄快取讀取和寫入 token。不要為了提高快取命中率而在前綴中保留無關材料,它們仍可能分散模型注意力,並增加存取控制複雜度。
對快取前綴進行版本管理。政策、來源或結構變更時,執行記錄應明確顯示使用的是哪個版本。
速率限制與可用性
GPT-6 模型頁面按使用層級列出速率限制,並說明不支援免費 API 層級。限制可隨使用和消費增長而提高。應用程式需要處理 429 回應、隊列背壓、取消,以及明確設計的備用模型。對於安全關鍵或結構敏感任務,切換模型時必須記錄並重新驗證輸出,不能靜默回退。
發布公告稱,符合條件的 API 客戶可以使用 Zero Data Retention。資格、資料駐留和安全處理是不同要求,應分別確認帳號與地區的適用情況。
OpenAI 還提醒,加強的防護可能停止正常工作。一份早期 Codex 社區報告記錄了普通儲存庫任務在執行後期多次因網路安全策略而中止的情況。應將其視為待測的個體失敗案例,而非已測得的發生率:記錄策略中止、損失所需時間、模型設定,以及備用方案是否安全完成任務。
遷移檢查清單
- 固定 20 至 50 個代表性任務和預期結果。
- 記錄目前模型、提示詞、工具、推理強度、延遲及合格任務成本。
- 先只更換模型,建立可比較基線。
- 重寫提示詞之前先檢查新行為。
- 使用缺失、衝突和過期證據測試長上下文。
- 測試工具拒絕、逾時、重複結果和取消。
- 測試檔案及網頁內容中的提示注入。
- 驗證 Structured Outputs 時,不僅檢查結構是否合規。
- 為每次執行增加預算和停止條件。
- 先分配少量符合條件的任務,再擴大範圍。
- 當需要可重現性且有合適快照時,固定模型快照。
- 保留經過測試的備用方案和回復路徑。
如需選用層面的比較,請閱讀 GPT-6 與 GPT-5.6 對比。
正式環境評估範本
工作流:[名稱和負責人]
模型:gpt-6-astra
推理強度:[low/medium/high/xhigh/max]
提示詞版本:[ID]
來源集:[ID、權限、檢索日期]
工具:[結構、範圍、逾時、冪等性]
輸出契約:[結構與語義檢查]
人工確認:[需要確認的操作]
預算:[token、工具、成本、時間]
失敗處理:[重試、備用方案、停止、升級處理]
驗收:[品質、安全、延遲、成本閾值]
審計記錄:[輸入、呼叫、審批、輸出、審核決定]Ottermind 可以將評估簡報、來源、測試輸出、審核決定和最終成果儲存在同一工作空間中。從一個邊界明確的流程開始,添加工具之前,先用提示詞工程指南明確任務契約。
常見問題
GPT-6 的 API 模型名稱是什麼?
在 OpenAI API 中使用 gpt-6-astra。
應該用 Chat Completions 還是 Responses API?
模型頁面列出了兩個端點,但 OpenAI 的 GPT-6 指南使用 Responses API,新流程能力也依賴該接口。新建工具型應用時優先使用 Responses。
GPT-6 支援微調嗎?
目前模型頁面說明不支援微調。
GPT-6 可以處理圖片嗎?
可以,模型頁面列出了圖片輸入。雖然圖片產生可作為工具使用,但直接圖片輸出並未列為模型模態。
一個 GPT-6 API 請求需要多少錢?
取決於輸入、輸出、快取、長提示詞倍數、處理模式、工具和重試。截至 2026 年 9 月 7 日,Standard 基礎費率為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。
每次請求都可以發送一百萬 token 嗎?
上下文視窗為 105 萬 token,但容量不等於建議用量。輸入超過 272,000 token 會觸發不同費率,超長提示詞仍需要仔細篩選來源並評估效果。
GPT-6 可以安全地自主呼叫工具嗎?
不應向任何模型提供不受限制的工具。應執行最小權限、參數驗證、重要操作確認,並審計可觀察行為。可以從 AI Agent 安全檢查清單開始。
