기술 가이드

GPT-6 API 가이드: 요금, 컨텍스트, 도구와 이전 절차

2026-09-07·읽는 시간 12분·2026-09-07 업데이트

OpenAI Responses API에서 gpt-6-astra를 지정하면 GPT-6로 개발할 수 있습니다. 텍스트·이미지 입력, 텍스트 출력, 함수 호출, Structured Outputs, 스트리밍과 OpenAI 호스팅 도구를 지원합니다. 컨텍스트는 1,050,000토큰, 최대 출력은 128,000토큰이며 Standard 입력은 100만당 10달러, 출력은 100만당 50달러입니다.

운영 환경 이전을 모델 문자열 변경만으로 시작하지 마세요. 비동기 도구, 턴 도중 지시, 대화 중 추론 갱신은 세션 상태, 대기 호출, 취소, 관측 가능성과 비용에 영향을 줍니다. 고정 평가 세트와 소규모 작업 배정으로 시작합니다.

출처: 모델 사양; 모델 안내; Responses API 이전 가이드; 발표; 안전성 개요; Artificial Analysis; API 비용·추론 강도 실측; 실무 기반 코드 시험. 2026년 9월 7일 확인.

빠른 사양 확인

설정현재 값
모델 IDgpt-6-astra
권장 APIResponses API
컨텍스트 창1,050,000토큰
최대 출력128,000토큰
지식 기준일2026년 4월 30일
추론 강도low, medium, high, xhigh, max
텍스트입력과 출력
이미지입력만
음성·영상 모달리티직접 지원하지 않음
함수 호출지원
Structured Outputs지원
미세 조정미지원
무료 API 계층미지원

외부 API 시험에서 확인된 점

초기 시험의 가장 분명한 교훈은 모델명만큼 설정도 중요하다는 것입니다.

Artificial Analysis는 OpenAI 자체 API로 Astra max를 평가했습니다. 현재 점수 55, 초당 출력 64.3토큰, 지수 과제당 2.57달러, 최대 추론에서 첫 토큰까지 약 355초입니다. Max는 의도적으로 비용이 큰 설정이지만 통합 앱이 gpt-6-astra라는 이름 뒤에 추론량, 지연과 비용을 숨기면 안 되는 이유를 보여 줍니다.

ComputingForGeeks는 실제 요청으로 공시 단가를 확인하고 같은 디버깅 문제를 여러 모델과 강도로 실행했습니다. Astra는 추론 3,525토큰, 75.5초, 약 0.194달러였고 Sol은 39.3초, 약 0.048달러였습니다. 진단은 같지만 Astra가 한계와 더 나은 확인 절차를 덧붙였습니다.

같은 Astra 질문에서 low를 max로 바꾸자 비용은 거의 10배, 지연은 약 8배 늘었다고도 합니다. Low에서 이미 세 원인을 찾았고 더 높은 강도는 상세한 계획을 내다가 시험의 6,000토큰 출력 한도에 도달했습니다. 단일 시험이지만 medium으로 시작해 측정상 이유가 있을 때만 높이고 출력을 제한하는 접근을 뒷받침합니다.

실무 코드 시험은 반대 측면도 보여 줍니다. 저렴한 모델이 테스트를 통과하고도 남긴 구성 요소 간 상태 오류를 Astra는 피했습니다. 한 API 호출은 비싸도 검토와 수정을 합친 합격 작업은 저렴할 수 있습니다. 두 비용을 모두 평가해야 합니다.

사양은 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, 호스팅 셸, 패치 적용, skills, 컴퓨터 조작, MCP, 도구 검색도 Responses API 기능으로 나열합니다. 지원한다고 자동 활성화·승인되거나 자신의 앱에 적합한 것은 아닙니다.

시연만으로 API에 대해 알 수 없는 것

Matt Shumer의 기록은 대규모 실험에 조율된 세션과 많은 토큰이 필요했고 장시간 작업은 정체되기도 했다고 합니다. 따라서 시간뿐 아니라 수락 목표에 가까워지는지도 측정해야 합니다. 출력을 계속 만드는 프로세스가 결과를 개선하고 있다는 보장은 없습니다.

Claire Vo의 에피소드 노트는 구현과 브라우저 QA를 함께 강조합니다. API 앱에서는 실행 환경이 완성물을 점검할 수 있는지가 관건입니다. 코드에는 동작 검증, 문서에는 출처 검증을 주어야 합니다. 텍스트만 생성하는 모델 호출로 여러 도구를 쓰는 시연을 재현할 수 없습니다.

이 경험은 시험 설계에 도움이 되지만 API 매개변수, 과금 방식이나 일반 완료율을 검증하지는 않습니다.

최소 Responses API 요청

현재 빠른 시작 문서가 권하는 공식 OpenAI SDK 버전을 사용하세요. 최소 JavaScript 요청은 다음과 같습니다.

프롬프트
import OpenAI from "openai";

const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6-astra",
  reasoning: { effort: "medium" },
  input: [
    {
      role: "developer",
      content: "Return a concise, source-grounded decision brief.",
    },
    {
      role: "user",
      content: "Compare the attached proposals against the approval criteria.",
    },
  ],
});

console.log(response.output_text);

API 키는 환경의 비밀값 관리에 두고 프롬프트, 소스 파일, 클라이언트 코드나 로그에 넣지 마세요. output_text만 반환된다고 가정하지 말고 실제 응답 객체를 검사합니다. 도구 호출과 구조화 항목도 포함될 수 있습니다.

추론 강도를 목적에 맞게 선택하세요

Astra는 none을 지원하지 않습니다. lowmedium부터 평가하고 품질 향상이 지연과 비용을 상쇄할 때 높입니다. OpenAI 표는 설정별 최고 점수를 보고하므로 자신의 강도에서 같은 결과를 보장하지 않습니다.

다음 같은 배정 기준을 사용할 수 있습니다.

작업 신호시작 강도
짧고 범위가 한정된 변환Low
명확한 기준의 다중 자료 분석Medium
어려운 계획, 코딩 또는 도구 조율High
낮은 강도 실패 후 드문 고가치 문제Xhigh 또는 max

매 실행에 강도를 기록합니다. 아니면 나중의 성능 저하가 설정 변경이 아니라 모델 문제처럼 보일 수 있습니다. 출력 예산도 제한하세요. 숨은 추론도 출력으로 과금돼 눈에 보이는 답이 끝나기 전에 큰 비용이 발생할 수 있습니다.

대화 중 추론 설정 변경

OpenAI는 캐시 접두부를 유지하면서 강도를 바꾸는 configuration_update 입력 항목을 설명합니다. 간단한 대화가 어려운 예외를 만나거나 복잡한 단계 뒤에 일상 후속 작업이 올 때 유용합니다.

최종 값만 아니라 설정의 시간순 기록을 남깁니다. Low에서 max로 바뀐 실행과 low를 유지한 실행의 예상 지연·비용은 다릅니다.

비동기 도구 호출

비동기 함수나 사용자 정의 도구를 쓰면 앱이 호출을 처리하는 동안 결과에 의존하지 않는 일을 계속할 수 있습니다. 준비된 결과는 원래 호출 ID로 반환합니다.

일반적인 분산 시스템 문제가 생깁니다.

  • 사용자가 취소하거나 변경한 뒤 결과가 도착할 수 있습니다.
  • 두 호출이 시작 순서와 다르게 끝날 수 있습니다.
  • 외부 쓰기가 성공한 뒤 시간 초과가 날 수 있습니다.
  • 멱등하지 않은 호출을 반복하면 행동이 중복될 수 있습니다.
  • 독립 작업은 끝났지만 필수 호출은 대기할 수 있습니다.

pending, completed, failed, cancelled, expired 상태를 영속 저장하세요. 쓰기에 멱등성 키를 사용하고 재시도 전에 정본 시스템을 조회하며, 오래된 작업 버전의 지연 결과를 거부합니다.

턴 도중 방향 수정

WebSocket 연결에서 Astra가 작업 중일 때 추가 사용자 지시를 보낼 수 있습니다. 긴 일을 재시작 없이 고치기 쉬워지지만 의도에 버전을 붙여야 합니다.

각 변경을 시각과 함께 저장하고 무효화된 대기 작업을 표시합니다. 보고서 독자가 바뀌면 집필은 계속할 수 있지만 외부 행동의 계정이나 목적지가 바뀌면 새 범위를 검증·승인할 때까지 멈춥니다.

구조화 출력과 도구

후속 코드가 스키마를 필요로 하면 Structured Outputs를 사용합니다. 스키마는 형태만 검증하고 사실은 보장하지 않습니다. 허용된 ID인지 확인하고 합계를 독립 계산하며 인용 자료를 검토한 뒤 객체를 수락합니다.

작은 범위의 도구를 설계하세요.

프롬프트
권장: create_draft_invoice(customer_id, line_items)
지양: run_shell(command)

권장: search_approved_project_sources(query, project_id)
지양: browse_any_url(url)

신원, 테넌트 범위, 인수, 예산과 확인은 프롬프트가 아니라 앱이 강제해야 합니다. 운영 시스템을 연결하기 전에 AI 에이전트 아키텍처를 확인하세요.

컴퓨터 조작

OpenAI 보고상 가장 강력한 조작 모델이지만 시각 UI는 비결정적이며 관찰과 실행 사이에 바뀔 수 있습니다. 클릭과 키 입력을 제안된 작업으로 다룹니다.

  1. 이용 가능한 앱, 계정, 업무 범위를 제한합니다.
  2. 판단에 사용된 상태를 저장합니다.
  3. 중요한 변경을 실행 전에 보여 줍니다.
  4. 전송, 삭제, 게시, 구매, 권한 변경에는 확인을 요구합니다.
  5. 실행 후 상태를 독립 읽기로 확인합니다.
  6. 진단과 취소를 위한 충분한 증거를 남깁니다.

데스크톱 AI 에이전트 가이드는 로컬 컴퓨터 접근이 위험을 어떻게 바꾸는지 설명합니다.

GPT-6 API 요금

OpenAI가 공시한 텍스트 100만 토큰당 요금입니다.

항목Standard 요금
입력10.00달러
캐시 입력1.00달러
캐시 쓰기12.50달러
출력50.00달러

입력 272,000토큰 초과 시 요청 전체의 입력·캐시는 두 배, 출력은 1.5배입니다. 캐시 쓰기는 비캐시 입력의 1.25배이고 Batch와 Flex는 Standard의 50%, Fast는 적용 단가의 두 배입니다. 도구 호출은 추가 비용이 있을 수 있습니다.

같은 토큰 사용량에서 Astra, Sol, Terra, Luna의 API 비용 예시

CodeRabbit가 고정 토큰 수와 2026년 9월 4일 요금으로 계산한 예시입니다. 완료 작업의 실측 비용은 아닙니다.

계산 예시

캐시 없는 입력 80,000토큰과 출력 8,000토큰의 Standard 요청은 대략 다음과 같습니다.

프롬프트
입력: 80,000 / 1,000,000 x $10 = $0.80
출력:  8,000 / 1,000,000 x $50 = $0.40
모델 소계: $1.20

도구, 캐시 쓰기, 재시도와 검토는 제외됩니다. 긴 프롬프트 임계값을 넘으면 전체 요청 계산에 위 배수가 적용됩니다.

프롬프트 캐시를 계획적으로 쓰세요

고정 지시, 스키마, 공통 자료를 자주 변하는 사용자 내용보다 앞에 두어 접두부를 재사용합니다. 캐시 읽기·쓰기 토큰을 따로 기록합니다. 적중률만 높이려고 무관한 내용을 남기면 모델을 산만하게 하고 권한 관리를 어렵게 만들 수 있습니다.

캐시 접두부를 버전 관리하세요. 정책, 자료나 스키마가 달라지면 실행 기록이 사용 버전을 정확히 보여 줘야 합니다.

속도 제한과 이용 가능성

사양은 사용 등급별 제한을 제시하고 무료 API 계층을 지원하지 않는다고 합니다. 사용과 지출에 따라 한도가 올라갈 수 있습니다. 429 응답, 큐 역압, 취소와 의도적으로 선택한 대체 모델에 대비하세요. 안전상 중요하거나 스키마에 민감한 작업에서 기록과 재검증 없이 조용히 모델을 바꾸면 안 됩니다.

출시 발표에 따르면 해당 고객은 Zero Data Retention을 이용할 수 있습니다. 자격, 데이터 저장 지역, 보안 처리는 각각 다른 요구이므로 계정·지역별로 확인합니다.

OpenAI는 강화된 보호가 정상 업무도 멈출 수 있다고 경고합니다. 한 초기 Codex 보고는 일반 저장소 작업이 후반에 반복적으로 보안 정책 때문에 끝났다고 합니다. 측정된 비율이 아닌 개별 실패 사례로 보고, 중단·잃은 시간·모델 설정·대체 경로의 안전한 완료 여부를 기록하세요.

이전 체크리스트

  • 대표 과제 20~50개와 기대 결과를 고정합니다.
  • 모델, 지시, 도구, 추론량, 지연과 합격 비용을 기록합니다.
  • 먼저 모델만 바꿔 비교 기준을 만듭니다.
  • 프롬프트를 고치기 전에 새 행동을 살핍니다.
  • 누락·충돌·낡은 증거로 긴 컨텍스트를 시험합니다.
  • 도구 거부, 시간 초과, 중복 결과와 취소를 시험합니다.
  • 파일과 웹 자료의 프롬프트 인젝션을 시험합니다.
  • Structured Outputs를 스키마 적합성 이상으로 검사합니다.
  • 모든 실행에 예산과 중단 조건을 둡니다.
  • 확대 전에 소량의 적합 과제만 배정합니다.
  • 재현성이 중요하고 적합한 스냅샷이 있으면 모델 버전을 고정합니다.
  • 시험한 대체 경로와 롤백 절차를 유지합니다.

모델 선택은 GPT-6와 GPT-5.6 비교를 참고하세요.

운영 평가 템플릿

프롬프트
업무: [이름과 담당자]
모델: gpt-6-astra
추론 강도: [low/medium/high/xhigh/max]
프롬프트 버전: [ID]
자료: [ID, 권한, 검색 날짜]
도구: [스키마, 범위, 시간 초과, 멱등성]
출력 계약: [스키마와 의미 검증]
사람 확인: [확인이 필요한 행동]
예산: [토큰, 도구, 비용, 시간]
실패 처리: [재시도, 대체, 중단, 에스컬레이션]
수락: [품질, 안전, 지연, 비용 임계값]
감사: [입력, 호출, 승인, 출력, 검토 결정]

Ottermind는 평가 브리프, 자료, 시험 결과, 검토 결정과 최종 산출물을 한 공간에 보관할 수 있습니다. 제한된 업무부터 시작하고 도구 추가 전에 프롬프트 엔지니어링 가이드로 계약을 분명히 하세요.

자주 묻는 질문

API 모델명은 무엇인가요?

OpenAI API에서 gpt-6-astra를 사용합니다.

Chat Completions와 Responses API 중 무엇을 쓰나요?

둘 다 사양에 있지만 GPT-6 안내는 Responses API를 사용하며 새로운 흐름도 여기에 의존합니다. 새로운 도구 앱에는 Responses를 우선하세요.

미세 조정을 지원하나요?

현재 사양에서는 지원하지 않습니다.

이미지를 처리할 수 있나요?

네, 이미지 입력을 받습니다. 직접 이미지 출력 모달리티는 없지만 생성 도구를 사용할 수 있습니다.

요청 한 번의 비용은 얼마인가요?

입출력, 캐시, 긴 입력 배수, 모드, 도구와 재시도에 달려 있습니다. 2026년 9월 7일 기준 Standard 입력은 100만 토큰당 10달러, 출력은 50달러입니다.

매번 100만 토큰을 보내도 되나요?

용량은 105만이지만 권장 사용량은 아닙니다. 입력 272,000을 넘으면 가격이 달라지며 자료 선택과 평가가 필요합니다.

자율 도구 사용은 안전한가요?

어떤 모델에도 무제한 도구를 주면 안 됩니다. 최소 권한, 인수 검증, 중요 행동 확인과 관측 가능한 행동 감사를 적용하세요. 보안 체크리스트부터 시작할 수 있습니다.

데스크톱 및 모바일 앱 다운로드

언제 어디서나 Ottermind에 접속하세요.

컴퓨터