Modellneuigkeiten

GPT-6 im Test: Veröffentlichung, unabhängige Ergebnisse und Fazit

2026-09-07·13 Min. Lesezeit·Aktualisiert am 2026-09-07

GPT-6 ist da, doch nicht jede Aufgabe profitiert automatisch vom Umstieg. OpenAI hat GPT-6 Astra am 3. September 2026 veröffentlicht. Die unabhängigen Tests der ersten Woche zeigen Fortschritte bei schwierigen, zusammenhängenden Arbeiten, aber auch hohe Latenz, einen höheren Preis und einen uneinheitlichen Nutzen bei Routineanfragen. Die Modellkennung in der API lautet gpt-6-astra.

Unsere Einschätzung: Astra eignet sich vor allem für anspruchsvolle Arbeit in langen, eng verzahnten Abläufen, nicht als Standard für Alltagschats oder Massengenerierung. Besonders überzeugend ist der Einsatz, wenn ein Modell ein großes System verstehen, mehrere Werkzeuge bedienen, verschiedene Vorgaben einhalten und ein Ergebnis mit hohen Fehlerkosten liefern muss. Für klar begrenzte Aufgaben bleiben Modelle der GPT-5.6-Klasse wirtschaftlicher.

Quellen: Veröffentlichungsankündigung; Modelldokumentation; Entwicklerleitfaden; Sicherheitsübersicht; Verfügbarkeit; Artificial Analysis; Coding-Vergleich anhand einer Produktionsaufgabe; API-Praxistests; Axios-Bericht; Stimmen von Sicherheitsexperten. Geprüft am 7. September 2026.

Die wichtigsten Antworten

FrageStand: 7. September 2026
Ist GPT-6 veröffentlicht?Ja. OpenAI veröffentlichte GPT-6 Astra am 3. September 2026.
Wie lautet die API-Modellkennung?gpt-6-astra
Gibt es GPT-6 in ChatGPT?GPT-6 Pro wird für berechtigte Pro-, Business- und Enterprise-Tarife freigeschaltet. Der Zugang hängt vom Produkt und den Workspace-Einstellungen ab.
Gibt es das Modell in Codex und ChatGPT Work?Die Freischaltung läuft. Laut OpenAI enthält Plus den Zugang in Work und Codex; für Chat gelten andere Regeln.
Was kostet die API?Standard: 10 US-Dollar je Million Eingabetokens und 50 US-Dollar je Million Ausgabetokens. Für Cache-Lese- und Schreibzugriffe gelten separate Preise.
Wie groß ist das Kontextfenster?1.050.000 Tokens, mit bis zu 128.000 Ausgabetokens.
Sollte jetzt jede Aufgabe umziehen?Nein. Prüfen Sie konkrete Aufgaben und migrieren Sie nur dort, wo der Nutzen Mehrkosten und Betriebsrisiken rechtfertigt.

Was unabhängige Tests zeigen

Die ersten externen Ergebnisse fallen zurückhaltender aus als die Ankündigung. Sie belegen Fortschritte, aber nicht, dass Astra jede Aufgabe gewinnt oder grundsätzlich das beste Preis-Leistungs-Verhältnis bietet.

Externer TestErgebnisPraktische Einordnung
Artificial Analysis Intelligence IndexAstra max erreicht 55 Punkte und Platz 3 von 202 Modellen im aktuellen StandSpitzenklasse, aber kein unangefochtener erster Platz
Geschwindigkeit bei Artificial Analysis64,3 Ausgabetokens pro Sekunde, Platz 93 von 202Unter dem Median der Vergleichsgruppe und langsamer als GPT-5.6 Sol max im selben Dienst
Kosten je Index-Aufgabe bei Artificial Analysis2,57 US-Dollar für Astra max gegenüber 1,25 US-Dollar für Sol maxVier zusätzliche Punkte bei ungefähr doppelten Kosten je Testaufgabe
Debugging-Test von ComputingForGeeksAstra, Sol, Terra und Luna finden dieselben drei UrsachenAstras Vorteil liegt in Einschränkungen und Prüfungen, nicht in einer anderen Diagnose
Coding-Vergleich aus der ProduktionBeide Modelle bestehen die vorhandenen Tests; nur Astra erhält gekoppelte Seitennavigationszustände und ergänzt einen TestGrüne Tests können Vertragsverletzungen verdecken; in diesem Fall verknüpft Astra Komponenten besser

Artificial Analysis misst bei Astra mit max-Aufwand außerdem rund 355 Sekunden bis zum ersten Token. Das ist eine Extremkonfiguration und keine normale Chaterwartung. Dennoch unterstreicht sie eine nützliche Regel: Maximaler Denkaufwand sollte bewusst für Forschung gewählt werden, nicht standardmäßig.

Der produktionsnahe Coding-Test ist besonders aufschlussreich. Beide Agenten bestanden 712 Testdateien. Trotzdem verlor Terras Implementierung in einer Interaktion den Zustand der anderen Seitennavigation. Astra bewahrte beide Zustände und prüfte ihre Beziehung ausdrücklich. Das spricht für Tests mit Astra bei stark verzahnten Implementierungen, bleibt aber ein vom Anbieter veröffentlichter Einzelfall und keine allgemeine Erfolgsquote.

Was Praxistester berichten

Claire Vos Early-Access-Bericht vom 3. September nennt konkrete Aufgaben: eine ChatPRD-Funktion, an der frühere Modelle scheiterten, Browser-QA, Hardwareintegration und 3D-Arbeit. Die Episodenseite enthält Zeitmarken zu den Vorführungen. Eine erfahrene Entwicklerin schildert ausgewählte Erfolge und legt den frühen Zugang offen; wiederholte Versuche oder eine durchschnittliche Fehlerquote fehlen. Besonders hilfreich sind die realen Aufgaben als Grundlage für eigene Vergleiche.

Matt Shumers Bericht vom 3. September beurteilt den täglichen Einsatz positiver als unsere kostenorientierte Empfehlung. Er nutzt Astra standardmäßig und lobt Backend-Entwicklung sowie verständliche Fortschrittsmeldungen. Zugleich nennt er schwächere visuelle Ergebnisse als bei Claude, langsamere Antworten und ambitionierte Projekte, die nicht mehr sinnvoll vorankommen. Seine großen Demonstrationen nutzten umfangreiche Koordination und vorhandene Assets. Diese Bedingungen sind wichtig, wenn ein Projekt als Ergebnis eines einzigen Prompts beschrieben wird.

Diese Tester widersprechen manchen frühen Community-Beschwerden über Absichtserkennung und Umfang. Die verfügbaren Belege sprechen dafür, das Verhalten an eigenen Aufgaben zu prüfen. Sie zeigen nicht, welche Erfahrung typisch ist.

ComputingForGeeks ließ denselben Debugging-Prompt über die API von vier OpenAI-Modellen bearbeiten. Alle fanden dieselben drei Ursachen. Astra benötigte 75,5 Sekunden und etwa 0,194 US-Dollar; Sol 39,3 Sekunden und etwa 0,048 US-Dollar. Der Tester hielt Astras zusätzliche Einschränkung für hilfreich, weil sie eine zu pauschale Diagnose verhinderte. Für alltägliche Bestätigungsfragen rechtfertigte das den Aufpreis aus seiner Sicht jedoch nicht.

Damit verändert sich die Kaufentscheidung. Astra muss keine völlig andere Antwort liefern, um wertvoll zu sein: Bei einem kritischen Vorfall kann eine fehlende Einschränkung entscheidend sein. Führen dagegen alle richtigen Antworten zur gleichen Handlung, gewinnt das günstigere Modell.

Die ersten Nutzerberichte sind gemischt. Ein erfahrener Codex-Nutzer berichtet von cleveren Lösungen, aber schwächerem Urteil zum Umfang, einschließlich unnötiger Infrastruktur vor einer Richtungsentscheidung. Ein anderer Entwickler beschreibt Astra als leistungsfähig, aber zu aufwendigen Lösungen neigend. Andere melden deutlich schnellere Abschlüsse schwieriger Repository-Arbeit. Diese unkontrollierten Erfahrungen hängen von Prompts, Codebasis, Produktlimits und Erwartungen ab. Sie liefern mögliche Fehlerszenarien, keine belastbare Zufriedenheitsnote.

Ein detaillierter Community-Bericht beschreibt 12 gewöhnliche Repository-Arbeitsschritte in acht Sitzungen, die nach längerer Laufzeit durch eine Cybersicherheitsrichtlinie beendet wurden. Das ist nicht unabhängig bestätigt, passt aber zu OpenAIs Hinweis, dass Schutzmaßnahmen legitime Arbeit pausieren oder stoppen können. Solche späten Abbrüche gehören in die Zuverlässigkeits- und Kostenmessung.

Von CodeRabbit veröffentlichter NIGHTSHIFT-Titelbildschirm

NIGHTSHIFT, mit GPT-6 unter menschlicher Anleitung und durch Iterationen entwickelt; veröffentlicht von CodeRabbit.

Was sich mit GPT-6 Astra ändert

Langer Kontext wird besser nutzbar

Die Modellseite nennt 1.050.000 Kontexttokens und maximal 128.000 Ausgabetokens. OpenAI meldet 96,3 % im MRCR-v2-Test mit acht Nadeln im Bereich 512K bis 1M, gegenüber 73,8 % für GPT-5.6 Sol. Ein großes Fenster ist trotzdem kein Grund, sämtliche Dateien zu senden. Suchqualität, Quelldaten, Konflikte und Einblick für Prüfer bleiben Aufgaben der Anwendung.

Computernutzung nähert sich realen Aufgaben

OpenAI meldet 72,6 % für Astra auf dem Offline-Datensatz von OSWorld 2.0 und 65,7 % für GPT-5.6 Sol. In der Latenzsimulation der Firma brauchte Astra etwa 40 statt 75 Minuten. Gezeigte Anwendungen sind Datensätze aktualisieren, Formulare ausfüllen, Tabellen bearbeiten, Dokumente erstellen und Websites prüfen.

Die richtige Schlussfolgerung lautet, dass mehr Aufgaben technisch möglich werden, nicht dass Autonomie nun sicher ist. Eng begrenzte Rechte, Aktionsvorschauen, Bestätigungen wichtiger Änderungen, Idempotenz und wiederherstellbare Auditspuren bleiben nötig. Unsere Sicherheitscheckliste für KI-Agenten beschreibt diese Grenzen genauer.

Laufende Arbeit lässt sich umsteuern

GPT-6 Astra ergänzt asynchrone Werkzeugaufrufe und Steuerung während eines Turns in der Responses API. Die Anwendung kann unabhängige Arbeit fortsetzen, während ein langsames Werkzeug läuft, und dessen Ergebnis über die Aufruf-ID zurückgeben. Nutzer können auch eine WebSocket-Sitzung korrigieren, ohne abgeschlossene Arbeit zu verwerfen. Dafür muss die Anwendung offene Aufrufe, Abbrüche, Zeitüberschreitungen und verspätete Ergebnisse verwalten.

Denkaufwand ändern, ohne den Prompt neu aufzubauen

Die API unterstützt low, medium, high, xhigh und max. Eine Konversation kann eine Konfigurationsänderung erhalten, die den Aufwand anpasst und den gecachten Prompt-Präfix bewahrt. Astra unterstützt die Einstellung none nicht.

Bessere Sicherheit, schwierigeres Monitoring

OpenAI meldet in mehreren internen Tests weniger schädliche oder außerhalb des Auftrags liegende Aktionen als bei GPT-5.6 Sol. Zugleich sei Astra anhand seines geschriebenen Denkprozesses schwerer zu überwachen, da es stärker kontrolliert, was darin erscheint. Beides ist relevant. Bessere Messwerte ersetzen keine Kontrollen; geringere Überwachbarkeit spricht dafür, beobachtbare Aktionen, Rechte, Eingaben und Ergebnisse zu bewerten, statt verborgenes Denken als Auditprotokoll zu behandeln.

Bedeutet GPT-6 AGI?

OpenAI bezeichnet Astra als sein intelligentestes und am besten ausgerichtetes Modell. Präsident Greg Brockman sagte bei der Pressevorstellung, er glaube persönlich, es könne die Ankunft von AGI markieren, überließ das Urteil aber den Nutzern. Das ist eine Behauptung und Interpretation, kein allgemein geklärter Messstandard.

Für Käufer und Entwickler sind vier Fragen konkreter:

  1. Erledigt das Modell repräsentative Aufgaben genauer?
  2. Sinkt der Gesamtaufwand einschließlich Prüfung und Korrektur?
  3. Bleibt es innerhalb vorgegebener Rechte und Grenzen?
  4. Rechtfertigt die Qualität die gesamten Kosten je akzeptiertem Ergebnis?

Die unabhängige Datenlage entscheidet die AGI-Frage nicht. Bei Artificial Analysis liegt Astra nahe der Spitze, aber nicht auf Platz eins; bei einer gekoppelten Coding-Aufgabe und OpenAIs Computertests fällt der Vorsprung größer aus. Die besten KI-Modelle 2026 hängen weiterhin von der Aufgabe ab. Ein Spitzenwert macht ein Modell nicht automatisch zur besten Wahl für Extraktion, Klassifizierung, Routineentwürfe oder Support in großem Umfang.

Wo GPT-6 verfügbar ist

OpenAI beschreibt eine schrittweise Einführung in ChatGPT, API, Microsoft Azure und Amazon Bedrock. Das aktualisierte Hilfezentrum unterscheidet die Zugangswege:

  • ChatGPT Chat: GPT-6 Pro wird für Pro zu 100 US-Dollar, Pro zu 200 US-Dollar, Business und Enterprise eingeführt. Kontingente sind begrenzt und tarifabhängig.
  • ChatGPT Work und Codex: Astra wird für Pro freigeschaltet; Plus enthält während der Einführung ebenfalls Zugang zu diesen Produkten.
  • API: Entwickler verwenden gpt-6-astra. Der kostenlose API-Tarif wird laut Modellseite nicht unterstützt.
  • Verwaltete Workspaces: Administratoren müssen den Zugang gegebenenfalls aktivieren. Bei Enterprise ist er laut Ankündigung zum Start standardmäßig aus.

Diese Angaben können sich rasch ändern. Prüfen Sie Hilfezentrum und Modellseite vor einer Buchung oder festen Einführungsplanung.

GPT-6-Preise richtig einordnen

Die Standard-API kostet laut OpenAI 10 US-Dollar je Million Eingabetokens und 50 US-Dollar je Million Ausgabetokens. Gecachte Eingaben kosten 1 US-Dollar, Cache-Schreibzugriffe 12,50 US-Dollar je Million. Bei mehr als 272.000 Eingabetokens gelten höhere Sätze für die gesamte Anfrage. Batch und Flex kosten die Hälfte von Standard; Fast verdoppelt den jeweils geltenden Satz.

Tokenpreis und Kosten einer abgeschlossenen Aufgabe sind verschieden. Astra kann weniger Ausgabetokens oder weniger Versuche benötigen. Im unabhängigen Debugging-Test war es für dieselbe Kerndiagnose allerdings etwa viermal so teuer wie Sol. Im produktionsnahen Coding-Test könnte es dagegen einen zusätzlichen Prüf- und Reparaturzyklus eingespart haben. Beides ist möglich. Messen Sie Kosten je akzeptierter Ausgabe einschließlich Wiederholungen, Werkzeuge, Prüfung, Richtlinienabbrüche und Fehler. Der GPT-6-API-Leitfaden bietet Vorlagen für Migration und Bewertung.

Ein praktischer Bewertungsrahmen

Lassen Sie 20 bis 50 identische, repräsentative Aufgaben vom aktuellen Modell und von Astra bearbeiten. Halten Sie Eingaben konstant und verbergen Sie die Modellidentität nach Möglichkeit vor den Prüfern.

DimensionWas erfassen?Empfohlene Hürde
KorrektheitFakten, Berechnungen und Vorgaben erfülltKeine Regression bei kritischen Feldern
AbschlussGefordertes Ergebnis ohne RettungseingriffRelevanter Gewinn bei schwierigen Aufgaben
UmfangUnnötige oder unerlaubte AktionsversucheKeine folgenreichen Grenzverletzungen
PrüfungMinuten und Änderungen bis zur AbnahmeGeringerer medianer Prüfaufwand
ZuverlässigkeitTimeouts, Werkzeugfehler, Wiederholungen und BlockadenInnerhalb des SLO des Ablaufs
KostenTokens, Werkzeuge, Versuche und Prüfarbeit pro ErgebnisPositiver Nutzen beim erwarteten Volumen

Beginnen Sie nicht nur mit einfachen Prompts. Prüfen Sie fehlende Angaben, widersprüchliche Quellen, Prompt Injection, veraltete Daten, Werkzeugausfälle, verweigerte Rechte und geänderte Anforderungen während der Arbeit.

Vorlage für den Bewertungsauftrag

Anweisung
Entscheidung: Soll [Ablauf] von [aktuellem Modell] zu GPT-6 Astra wechseln?
Aufgabensatz: [repräsentative Produktionsfälle]
Feste Eingaben: [Quellen-IDs und Daten]
Erlaubte Werkzeuge: [Namen und Berechtigungsumfang]
Gefordertes Ergebnis: [Schema oder Abnahmekriterien]
Stoppbedingungen: [fehlende Belege, verweigerte Rechte, Budget]
Prüfkriterien: Korrektheit, Vollständigkeit, Umfang, Klarheit
Kosten: Eingabe, Ausgabe, Cache, Werkzeuge, Versuche, Prüfminuten
Einführungshürde: [Zahlenwerte und Fehler mit Nulltoleranz]

Wann GPT-6 jetzt sinnvoll ist

Starten Sie mit schwierigen, teuren Aufgaben, bei denen stärkere Planung und Computernutzung mehrere Übergaben ersetzen könnten: komplexes Coding, Recherche mit mehreren Quellen, Dokumente, Tabellen oder begrenzte Arbeiten in professioneller Software. Routineabschnitte bleiben bei schnelleren, günstigeren Modellen, bis Daten einen Wechsel stützen.

Wählen Sie Astra nicht automatisch für kurze Fragen, Massentexte, mechanische Änderungen oder Aufgaben, die mit günstigeren Modellen schon gut prüfbar sind. Achten Sie auf unnötige Komplexität, lange Wartezeiten bei maximalem Denkaufwand, späte Sicherheitsabbrüche und beeindruckende Implementierungen, deren Produktverhalten noch geprüft werden muss.

Ottermind verbindet die Bewertung zu einem Projekt: Auftrag, Quellen, Modellausgaben, Prüfnotizen und Ergebnis bleiben zusammen, statt isolierte Chats zu vergleichen. Beginnen Sie mit einem echten Ergebnis in einem KI-Agenten-Workspace und erweitern Sie nur bei ausreichenden Belegen.

Praktische nächste Schritte finden Sie in GPT-6 verwenden, dem Coding-Test und dem Leitfaden für lange Aufgaben.

Häufige Fragen

Wann wurde GPT-6 veröffentlicht?

OpenAI veröffentlichte GPT-6 Astra am 3. September 2026. Der Zugang wird schrittweise freigeschaltet.

Sind GPT-6 und GPT-6 Astra dasselbe?

GPT-6 bezeichnet die Generation, Astra das veröffentlichte Spitzenmodell. In der API lautet die Kennung gpt-6-astra; ChatGPT zeigt eine Astra-basierte Option für Berechtigte als GPT-6 Pro an.

Können ChatGPT-Plus-Nutzer GPT-6 verwenden?

Laut aktuellem Hilfezentrum erhält Plus Astra in ChatGPT Work und Codex während der Einführung. GPT-6 Pro im normalen Chat ist für berechtigte Pro-, Business- und Enterprise-Tarife vorgesehen. Der Zugang kann vorübergehend abweichen.

Ist GPT-6 besser als GPT-5.6 Sol?

OpenAI meldet starke Verbesserungen bei Computernutzung, Automatisierung, Coding, langem Kontext, Wissenschaft und Sicherheitsprüfungen. Ein konkreter Ablauf braucht dennoch einen kontrollierten Aufgabentest. Siehe GPT-6 im Vergleich zu GPT-5.6.

Unterstützt GPT-6 Bilder, Audio und Video?

Die API-Modellseite nennt Text- und Bildeingaben, Textausgaben und keine direkte Audio- oder Videomodalität. Verfügbare Werkzeuge sind davon getrennt zu betrachten.

Kann GPT-6 sicher autonom arbeiten?

Kein Modell sollte allein aufgrund von Benchmarks weitreichende, folgenreiche Zugriffe erhalten. Nutzen Sie minimale Rechte, klare Aktionsgrenzen, Bestätigungen, Monitoring und Wiederherstellungsmöglichkeiten.

Desktop- und Mobile-App herunterladen

Greife jederzeit und überall auf Ottermind zu.

Computer