技術ガイド

GPT-6 APIガイド:料金、コンテキスト、ツールと移行手順

2026-09-07·読了時間:12分·2026-09-07 更新

OpenAI Responses APIで gpt-6-astra を指定すると、GPT-6を使った開発ができます。 テキスト・画像入力、テキスト出力、関数呼び出し、Structured Outputs、ストリーミング、OpenAIのホスト型ツールに対応します。コンテキストは1,050,000トークン、出力上限は128,000トークン。Standardは入力100万トークン10米ドル、出力100万50米ドルです。

本番移行をモデル文字列の置き換えだけで始めないでください。非同期呼び出し、ターン中の指示、会話中の推論量更新は、セッション状態、保留呼び出し、キャンセル、観測性、費用に影響します。固定した評価セットと小規模な振り分け導入から始めます。

出典: モデル仕様; モデルガイド; Responses API移行ガイド; 公開発表; 安全性の概要; Artificial Analysis; API料金と推論量の実測; 実務由来のコード試験。2026年9月7日確認。

仕様一覧

設定現在の値
モデルIDgpt-6-astra
推奨APIResponses API
コンテキスト1,050,000トークン
最大出力128,000トークン
知識の期限2026年4月30日
推論量lowmediumhighxhighmax
テキスト入出力
画像入力のみ
音声・動画モダリティ直接対応なし
関数呼び出し対応
Structured Outputs対応
ファインチューニング非対応
無料API層非対応

第三者のAPI試験で分かったこと

初期試験の明確な教訓は、モデル名と同じくらい設定が重要だということです。

Artificial AnalysisはOpenAIの直接APIでAstra maxを試しました。現在の集計では知能指数55、毎秒64.3出力トークン、指標課題当たり2.57米ドル、最大推論で最初のトークンまで約355秒です。Maxは意図して高負荷にする設定ですが、この値は gpt-6-astra という名前だけで済ませず、推論量、待ち時間、費用を利用者に見せる理由になります。

ComputingForGeeksは実際のリクエストで単価を確認し、同じデバッグ課題を複数モデルと推論設定に渡しました。Astraは3,525推論トークン、75.5秒、約0.194米ドル。Solは39.3秒、約0.048米ドルでした。診断は同じで、Astraは留保とより良い確認手順を付けています。

同じAstraの質問でlowからmaxにすると費用は約10倍、遅延は約8倍になったとも報告しています。Lowで3原因はすでに特定され、追加推論は詳しい計画を作りましたが、最後は設定された6,000トークンの出力上限に達しました。単一試験ですが、mediumから始め、測定上の理由がある場合だけ増やし、出力上限を設定する方針を支持します。

実務由来のコード試験では逆の面が見えます。安いモデルがテスト合格後も残した部品間状態の不具合をAstraは防ぎました。API呼び出し単体は高くても、レビューと修正後の合格タスクは安くなる可能性があります。評価には両方の数字が必要です。

仕様にはWeb検索、ファイル検索、画像生成、コードインタープリター、ホスト型シェル、パッチ適用、skills、操作、MCP、ツール検索も挙がっています。対応するツールが自動的に有効・許可済みで、用途に適するとは限りません。

実演だけではAPIの何が分からないか

Matt Shumerの記録では、大規模実験は複数セッションの調整と大量トークンを要し、長い実行が停滞することもありました。経過時間だけでなく、合格に近づいたかを測る必要があります。出力を続ける処理が、成果を改善し続けているとは限りません。

Claire Voの番組ノートは、実装に加えブラウザーQAを重視します。APIアプリでは、実行環境が完成品を検査できるかが対応する問いです。コードには動作検証、文書には出典検証を用意します。テキスト応答のみでは多機能ツールの実演は再現できません。

これらは試験設計に役立ちますが、APIパラメーター、請求挙動、一般的な完了率を検証するものではありません。

最小のResponses API呼び出し

最新クイックスタートが推奨する公式OpenAI SDKを使用します。最小構成のJavaScriptは次のとおりです。

プロンプト
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6-astra",
  reasoning: { effort: "medium" },
  input: [
    {
      role: "developer",
      content: "Return a concise, source-grounded decision brief.",
    },
    {
      role: "user",
      content: "Compare the attached proposals against the approval criteria.",
    },
  ],
});

console.log(response.output_text);

APIキーは環境で管理するシークレットに置き、プロンプト、ソース、クライアントコード、ログに含めないでください。output_text だけと想定せず、実際のレスポンスを検証します。ツール呼び出しや構造化要素が入る場合もあります。

推論量を意識して選ぶ

none は使えません。評価は low または medium で始め、品質差が時間と費用に見合う箇所だけ増やします。OpenAIの表は設定間の最高点なので、掲載スコアが選択した設定で出る保証はありません。

例えば次のように振り分けます。

タスクの特徴初期設定
短く範囲が限定された変換Low
明確な基準による複数資料の分析Medium
難しい計画、コード、ツール調整High
低い設定で失敗した、稀で高価値の課題Xhighまたはmax

各実行に推論設定を記録します。そうしないと、単なる設定変更がモデルの劣化に見えることがあります。最大出力も制限してください。隠れた推論は出力として課金され、高設定では見える回答が完成する前に費用が膨らみます。

会話中の推論設定更新

OpenAIは、キャッシュされた先頭部分を保ちつつ推論量を変える configuration_update 入力を説明しています。簡単な会話が難しい例外に遭遇した時や、複雑な段階が終わって定型作業に移る時に使えます。

最終設定だけでなく、変更の時系列を記録します。Lowからmaxになった実行と、lowのままの実行では費用と時間の見込みが異なります。

非同期ツール呼び出し

非同期関数や独自ツールなら、アプリが呼び出しを処理する間もAstraは結果に依存しない作業を続けられます。完了した結果は元の呼び出しIDで返します。

一般的な分散処理の問題が生じます。

  • ユーザーのキャンセルや変更後に結果が到着する。
  • 2つの呼び出しが開始順と異なる順に完了する。
  • 外部への書き込み成功後にタイムアウトする。
  • 冪等でない呼び出しを再試行して操作が重複する。
  • 独立作業は全部終わっても必要な呼び出しが保留される。

pendingcompletedfailedcancelledexpired を含む状態機械を永続保存します。書き込みに冪等キーを使い、再試行前に正本システムへ問い合わせ、古いタスク版の遅延結果は拒否します。

ターン中の指示変更

WebSocketでは、Astraの実行中に追加のユーザー指示を送れます。長い仕事を再起動なしで修正できますが、意図の版管理が必要です。

変更イベントを時刻付きで保存し、どの保留操作を無効化したか示します。報告書の読者変更なら執筆を続けられますが、外部操作の口座や宛先が変わる場合は、新範囲を検証・承認するまで止めます。

構造化出力とツール

後段のコードがスキーマを必要とするならStructured Outputsを使います。ただし形状の検証であって事実の検証ではありません。IDの許可値、独立計算した合計、引用資料を確認してからオブジェクトを受け入れます。

範囲の狭いツールを設計します。

プロンプト
推奨:create_draft_invoice(customer_id, line_items)
回避:run_shell(command)

推奨:search_approved_project_sources(query, project_id)
回避:browse_any_url(url)

本人確認、テナント範囲、引数、予算、確認は、プロンプトではなくアプリが強制する必要があります。本番システムにつなぐ前にAIエージェントのアーキテクチャを確認しましょう。

コンピューター操作

OpenAIの報告上では最高性能の操作モデルですが、視覚UIは確定的でなく、観測から実行までに変わる可能性があります。クリックや入力を提案された操作として扱います。

  1. 利用できるアプリ、アカウント、作業範囲を制限する。
  2. 判断に使った状態を記録する。
  3. 重大な変更は事前に提示する。
  4. 送信、削除、公開、購入、権限変更には確認を求める。
  5. 操作後を独立した読み取りで確かめる。
  6. 原因調査と取り消しに十分な証拠を残す。

デスクトップAIエージェントのガイドでは、ローカル操作がリスクをどう変えるか説明します。

GPT-6 APIの料金

OpenAIが示すテキスト100万トークン当たりの料金は次のとおりです。

項目Standard料金
入力10.00米ドル
キャッシュ入力1.00米ドル
キャッシュ書き込み12.50米ドル
出力50.00米ドル

入力272,000トークン超では、リクエスト全体に入力・キャッシュ2倍、出力1.5倍が適用されます。キャッシュ書き込みは未キャッシュ入力の1.25倍。BatchとFlexはStandardの50%、Fastは適用単価の2倍です。ツールの費用は別途発生し得ます。

同一トークン使用量でのAstra、Sol、Terra、LunaのAPI費用例

CodeRabbitによる固定トークン数と2026年9月4日の単価を使った費用例です。完了タスクの実測費用ではありません。

計算例

未キャッシュ入力80,000、出力8,000トークンのStandardリクエストは概算で次のようになります。

プロンプト
入力:80,000 / 1,000,000 x $10 = $0.80
出力: 8,000 / 1,000,000 x $50 = $0.40
モデル小計:$1.20

ツール、キャッシュ書き込み、再試行、レビューを含みません。長文入力の閾値を超えると、全体の計算に前述の係数が適用されます。

キャッシュを計画的に使う

安定した指示、スキーマ、共通資料を、変化の多いユーザー入力より前に置き、共通の先頭部分を再利用します。読み取りと書き込みのトークンは別々に追跡します。ヒット率だけを上げるために無関係な資料を残すと、注意をそらし、権限管理を複雑にします。

キャッシュ部分にもバージョンを付けます。規則、資料、スキーマが変わったら、使った版を実行記録で特定できるようにします。

レート制限と利用条件

モデル仕様には利用層別の制限と、無料API層が非対応であることが記載されています。利用と支出で上限が増える場合があります。429、キューの負荷制御、キャンセル、意図した代替モデルに対応してください。安全上重要な仕事やスキーマに敏感な仕事では、記録と再検証をせず黙ってモデルを切り替えてはいけません。

公開発表によると、対象API顧客はZero Data Retentionを利用できます。資格、データ所在、安全処理は別々の条件なので、アカウントと地域ごとに確認します。

保護機能が正当な作業を止めることもOpenAIは注意しています。初期Codex利用報告では、通常のリポジトリ作業が終盤で繰り返しサイバー方針により停止しました。統計的な発生率ではなく個別の検証対象として、停止、損失時間、構成、代替処理が安全に完了したかを記録します。

移行チェックリスト

  • 20〜50件の代表タスクと期待結果を固定する。
  • 現行モデル、指示、ツール、推論量、遅延、合格タスク費を記録する。
  • 最初はモデルだけを変えて比較の基準を作る。
  • プロンプト修正前に新しい挙動を確認する。
  • 欠落、矛盾、古い証拠で長文コンテキストを試す。
  • ツール拒否、タイムアウト、結果重複、キャンセルを試す。
  • ファイルとWebのプロンプトインジェクションを試す。
  • Structured Outputsはスキーマ以上の内容も検証する。
  • 各実行に予算と停止条件を付ける。
  • 拡大前に適した仕事を少量割り当てる。
  • 再現性が必要で適切な版があればモデルのスナップショットを固定する。
  • 試験済みの代替手段とロールバックを残す。

モデル選びはGPT-6とGPT-5.6の比較をご覧ください。

本番評価テンプレート

プロンプト
業務:[名称と担当者]
モデル:gpt-6-astra
推論量:[low/medium/high/xhigh/max]
プロンプト版:[ID]
資料:[ID、権限、取得日]
ツール:[スキーマ、範囲、タイムアウト、冪等性]
出力契約:[スキーマと意味上のチェック]
人の確認:[確認を必要とする操作]
予算:[トークン、ツール、費用、時間]
失敗時:[再試行、代替、停止、エスカレーション]
受け入れ:[品質、安全、時間、費用の閾値]
監査:[入力、呼び出し、承認、出力、レビュー判断]

Ottermindなら評価依頼、資料、試験結果、レビュー判断、最終成果を1つのワークスペースに保てます。小さな範囲から始め、ツール追加前にプロンプトエンジニアリングガイドで仕事の契約を明確にしましょう。

よくある質問

APIのモデル名は何ですか?

OpenAI APIで gpt-6-astra を指定します。

Chat CompletionsとResponses APIのどちらですか?

仕様は両方を示しますが、GPT-6ガイドはResponses APIを使い、新しい機能もそれに依存します。新規ツール型アプリにはResponsesを推奨します。

ファインチューニングできますか?

現在のモデル仕様では非対応です。

画像を処理できますか?

はい、画像入力に対応します。画像を直接出すモデルではありませんが、画像生成ツールを使えます。

1回のリクエストはいくらですか?

入力、出力、キャッシュ、長文係数、処理モード、ツール、再試行次第です。2026年9月7日時点のStandardは、入力100万トークン10米ドル、出力100万50米ドルです。

毎回100万トークン送れますか?

容量は105万ですが、常用の推奨ではありません。入力272,000を超えると料金が変わり、資料選択と評価も必要です。

自律的なツール使用は安全ですか?

無制限のツール権限は与えるべきではありません。最小権限、引数検証、重要操作の確認、観測可能な行動の監査が必要です。安全チェックリストから始めてください。

デスクトップ版とモバイル版をダウンロード

いつでもどこでも Ottermind にアクセスできます。

パソコン