技术指南

GPT-6 API 指南:Astra 定价、上下文、工具与迁移

2026-09-07·12 分钟阅读·更新于 2026-09-07

在 OpenAI Responses API 中指定 gpt-6-astra,即可使用 GPT-6 构建应用。 该模型支持文本和图片输入、文本输出、函数调用、Structured Outputs、流式响应以及 OpenAI 托管工具。上下文窗口为 1,050,000 token,最大输出为 128,000 token;Standard 模式每百万输入 token 10 美元,每百万输出 token 50 美元。

生产迁移不能只改模型名称。GPT-6 新增了异步工具调用、轮次内引导和会话中调整推理设置。这些能力会影响会话状态、待处理调用、取消、可观测性和成本。应先固定评估集,再将少量任务分配给新模型试运行。

来源: 模型页面; 模型指南; Responses API 迁移指南; 发布公告; 安全概览; Artificial Analysis; API 成本与推理强度实测; 源于生产任务的编程测试。核验日期:2026 年 9 月 7 日。

参数速查

设置当前值
模型 IDgpt-6-astra
推荐 APIResponses API
上下文窗口1,050,000 token
最大输出128,000 token
知识截止日期2026 年 4 月 30 日
推理强度lowmediumhighxhighmax
文本支持输入和输出
图片仅支持输入
音频和视频模态不直接支持
函数调用支持
Structured Outputs支持
微调不支持
免费 API 层级不支持

第三方 API 测试发现了什么

早期测试最明确的启示是:模型配置与模型名称同样重要。

Artificial Analysis 通过 OpenAI 官方 API 测试了 Astra max。当前快照中,其智能指数为 55,输出速度为每秒 64.3 token,每项指数任务成本为 2.57 美元,最高推理强度下首次输出 token 的等待约为 355 秒。Max 本就是刻意采用的高成本配置,但这些数据说明,API 集成必须让推理强度、延迟和成本可见,不能仅用一个 gpt-6-astra 标签概括体验。

ComputingForGeeks 用实际请求核对了公布的 token 费率,再让不同模型及推理强度处理同一调试问题。其模型对比中,Astra 使用 3,525 个推理 token,耗时 75.5 秒,成本约 0.194 美元;Sol 耗时 39.3 秒,成本约 0.048 美元。两者诊断相同,但 Astra 补充了限制说明和更充分的确认步骤。

评测者还报告,对同一个 Astra 问题从 low 升到 max 后,成本增加到接近 10 倍,延迟约为 8 倍。Low 已经找出三个原因;更高强度提供了更详细的方案,并最终触及评测者设置的 6,000 token 输出上限。这只是一次测试,但支持较稳妥的默认策略:从 medium 开始,有测量依据时再提高强度,并设置输出上限。

源于生产任务的编程测试展示了另一面:便宜模型虽然通过测试,却交付了跨组件状态错误,而 Astra 避免了该问题。单次 API 调用可能更贵,但算上审核与修复后,完成合格任务的总成本反而更低。评估需要同时记录这两个数字。

模型页面还列出了 Responses API 支持的网页搜索、文件搜索、图片生成、代码解释器、托管 shell、补丁应用、skills、计算机操作、MCP 和工具搜索。支持某个工具并不意味着它已自动启用、获得授权或适合你的应用。

创作者演示不能证明哪些 API 能力

Matt Shumer 的体验文章表示,他最大的实验依赖会话协调和大量 token,长时间运行也可能陷入停滞。因此,集成应用除了记录耗时,还应测量距离验收目标是否更近。一个仍在生成输出的进程,可能已经不再改善交付物。

Claire Vo 的节目笔记在实现之外强调了浏览器 QA。对 API 应用,相应的问题是运行环境能否检查完成后的成果。代码任务需要行为验收,文档任务需要来源检查;只有模型文本输出,无法复现依赖丰富工具的演示。

这些体验有助于设计测试,但不能验证 API 参数、计费行为或普遍完成率。

最小 Responses API 请求

使用当前快速入门推荐的官方 OpenAI SDK 版本。最小 JavaScript 请求结构如下:

提示词
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6-astra",
  reasoning: { effort: "medium" },
  input: [
    {
      role: "developer",
      content: "Return a concise, source-grounded decision brief.",
    },
    {
      role: "user",
      content: "Compare the attached proposals against the approval criteria.",
    },
  ],
});

console.log(response.output_text);

API 密钥应放在环境管理的密钥配置中,不能写进提示词、源码、客户端代码或日志。应验证实际响应对象,不能假定 output_text 是唯一输出,因为响应中还可能出现工具调用和结构化项目。

有目的地选择推理强度

GPT-6 Astra 不支持 none。评估时从 lowmedium 开始,只有质量提升足以抵消延迟和成本时才提高强度。OpenAI 的评估表报告各推理强度中的最高分,因此宣传中的基准得分并不保证在你选择的配置下也能达到。

可参考以下任务分配策略:

任务信号起始强度
简短、边界明确的转换Low
有明确标准的多来源分析Medium
困难的规划、编程或工具协调High
低强度失败后的少见高价值问题Xhigh 或 max

每次运行都应记录推理强度。否则,后续表现退步可能看似模型变化,实际只是配置变了。还应设置最大输出预算:隐藏推理按输出计费,高强度运行可能在可见答案完成前就产生大量费用。

在会话中调整推理

OpenAI 文档介绍了 configuration_update 输入项,可在保留缓存提示词前缀的同时更改推理强度。当简单会话遇到复杂异常,或复杂阶段结束后转入常规后续工作时,这很有用。

应用应记录配置变更时间线,而不只是最后的设置。从 low 升到 max 的运行,与始终保持 low 的运行,其预期延迟和成本不同。

异步工具调用

使用异步函数或自定义工具时,应用执行调用期间,Astra 可以继续处理不依赖该结果的工作。结果就绪后,通过原始调用 ID 返回。

异步执行会引入常见的分布式系统问题:

  • 用户取消或修改任务后,结果才返回。
  • 两个调用可能以不同于发起顺序的次序完成。
  • 外部写入已成功,但请求仍发生超时。
  • 重试非幂等调用可能重复执行操作。
  • 所有独立工作都已完成,但必需调用仍待处理。

持久化保存包含 pendingcompletedfailedcancelledexpired 状态的状态机。写操作使用幂等键;重试前查询权威系统;拒绝属于过期任务版本的延迟结果。

轮次内引导

通过 WebSocket 连接,应用可在 Astra 工作时发送新的用户指令。这让长任务无需重启就能纠正,但也要求对用户意图进行版本管理。

每次方向调整都应记录时间戳,并标记哪些待处理操作因此失效。如果用户改变报告受众,起草工作可以继续;如果用户改变外部操作的账户或目标位置,应先暂停,直到新范围得到验证和批准。

结构化输出与工具

下游代码需要固定结构时,使用 Structured Outputs。结构验证只能保证形状,不能保证事实正确。接受对象前,应核对标识符是否属于允许值、独立计算总数,并验证引用来源。

设计职责明确的工具:

提示词
优先:create_draft_invoice(customer_id, line_items)
避免:run_shell(command)

优先:search_approved_project_sources(query, project_id)
避免:browse_any_url(url)

身份、租户范围、允许参数、预算和确认必须由应用执行,不能只依赖提示词。连接生产系统前,请阅读 AI Agent 架构指南

计算机操作

按 OpenAI 报告,GPT-6 Astra 是其计算机操作能力最强的模型,但视觉界面并非确定性环境,观察与操作之间可能发生变化。应将点击和按键视为拟执行操作:

  1. 限定可用应用、账户和任务范围。
  2. 保存决策所依据的界面状态。
  3. 执行重要变更前展示预览。
  4. 发送、删除、发布、购买或权限修改前要求确认。
  5. 独立读取并验证操作后的状态。
  6. 保留足够证据,以便诊断和撤销失败操作。

桌面 AI Agent 指南介绍了本地计算机访问如何改变风险模型。

GPT-6 API 定价

OpenAI 列出的 GPT-6 Astra 每百万文本 token 费率如下:

计费项Standard 费率
输入10.00 美元
缓存输入1.00 美元
缓存写入12.50 美元
输出50.00 美元

输入超过 272,000 token 时,整个请求的输入及缓存费率为两倍,输出费率为 1.5 倍。缓存写入为未缓存输入费率的 1.25 倍。Batch 和 Flex 为 Standard 的 50%;Fast 模式为适用价格的两倍。工具调用可能另行收费。

固定 token 用量下 Astra、Sol、Terra 和 Luna 的 API 成本示意图

CodeRabbit 按固定 token 数量及 2026 年 9 月 4 日费率绘制的成本示意,不是完成任务的实测费用。

成本示例

一个包含 80,000 个未缓存输入 token 和 8,000 个输出 token 的 Standard 请求,费用约为:

提示词
输入:80,000 / 1,000,000 x $10 = $0.80
输出:8,000 / 1,000,000 x $50 = $0.40
模型费用小计:$1.20

该示例不含工具、缓存写入、重试和审核。超过长提示词阈值后,前述倍数会作用于整个请求的计费。

合理使用提示词缓存

将稳定指令、结构定义和共享来源放在经常变化的用户内容之前,让请求可以复用共同前缀。分别记录缓存读取和写入 token。不要为了提高缓存命中率而在前缀中保留无关材料,它们仍可能分散模型注意力,并增加访问控制复杂度。

对缓存前缀进行版本管理。政策、来源或结构变更时,运行记录应明确显示使用的是哪个版本。

速率限制与可用性

GPT-6 模型页面按使用层级列出速率限制,并说明不支持免费 API 层级。限制可随使用和消费增长而提高。应用需要处理 429 响应、队列背压、取消,以及明确设计的备用模型。对于安全关键或结构敏感任务,切换模型时必须记录并重新验证输出,不能静默回退。

发布公告称,符合条件的 API 客户可以使用 Zero Data Retention。资格、数据驻留和安全处理是不同要求,应分别确认账户与地区的适用情况。

OpenAI 还提醒,加强的防护可能停止正常工作。一份早期 Codex 社区报告记录了普通仓库任务在运行后期多次因网络安全策略而中止的情况。应将其视为待测的个体失败案例,而非已测得的发生率:记录策略中止、损失耗时、模型配置,以及备用方案是否安全完成任务。

迁移检查清单

  • 固定 20 至 50 个代表性任务和预期结果。
  • 记录当前模型、提示词、工具、推理强度、延迟及合格任务成本。
  • 先只更换模型,建立可比较基线。
  • 重写提示词之前先检查新行为。
  • 使用缺失、冲突和过期证据测试长上下文。
  • 测试工具拒绝、超时、重复结果和取消。
  • 测试文件及网页内容中的提示注入。
  • 验证 Structured Outputs 时,不仅检查结构是否合规。
  • 为每次运行增加预算和停止条件。
  • 先分配少量符合条件的任务,再扩大范围。
  • 当需要可复现性且有合适快照时,固定模型快照。
  • 保留经过测试的备用方案和回滚路径。

如需选型层面的比较,请阅读 GPT-6 与 GPT-5.6 对比

生产评估模板

提示词
工作流:[名称和负责人]
模型:gpt-6-astra
推理强度:[low/medium/high/xhigh/max]
提示词版本:[ID]
来源集:[ID、权限、检索日期]
工具:[结构、范围、超时、幂等性]
输出契约:[结构与语义检查]
人工确认:[需要确认的操作]
预算:[token、工具、成本、时间]
失败处理:[重试、备用方案、停止、升级处理]
验收:[质量、安全、延迟、成本阈值]
审计记录:[输入、调用、审批、输出、审核决定]

Ottermind 可以将评估简报、来源、测试输出、审核决定和最终成果保存在同一工作空间中。从一个边界明确的流程开始,添加工具之前,先用提示词工程指南明确任务契约。

常见问题

GPT-6 的 API 模型名称是什么?

在 OpenAI API 中使用 gpt-6-astra

应该用 Chat Completions 还是 Responses API?

模型页面列出了两个端点,但 OpenAI 的 GPT-6 指南使用 Responses API,新流程能力也依赖该接口。新建工具型应用时优先使用 Responses。

GPT-6 支持微调吗?

当前模型页面说明不支持微调。

GPT-6 可以处理图片吗?

可以,模型页面列出了图片输入。虽然图片生成可作为工具使用,但直接图片输出并未列为模型模态。

一个 GPT-6 API 请求需要多少钱?

取决于输入、输出、缓存、长提示词倍数、处理模式、工具和重试。截至 2026 年 9 月 7 日,Standard 基础费率为每百万输入 token 10 美元、每百万输出 token 50 美元。

每次请求都可以发送一百万 token 吗?

上下文窗口为 105 万 token,但容量不等于建议用量。输入超过 272,000 token 会触发不同费率,超长提示词仍需要仔细筛选来源并评估效果。

GPT-6 可以安全地自主调用工具吗?

不应向任何模型提供不受限制的工具。应执行最小权限、参数验证、重要操作确认,并审计可观察行为。可以从 AI Agent 安全检查清单开始。

下载桌面端与移动端 App

随时随地访问 Ottermind。

电脑