Claude Opus 5.5 gegen GPT-6 Sol: der gleiche Sturm in 3D

Anthropic und OpenAI haben am selben Tag Claude Opus 5.5 und GPT-6 Sol veröffentlicht. Ich habe beiden die Aufgabe unseres ersten Duells gestellt, ein Segelboot in einem nächtlichen Sturm in 3D, und beide Szenen laufen hier, mit Zeit und Preis für jede.

Claude Opus 5.5 gegen GPT-6 Sol: der gleiche Sturm in 3D
Schnelle Antwort

Bei derselben Aufgabe in 3D, ein Fischerboot in einem nächtlichen Sturm, liefert Claude Opus 5.5 in Claude Code die originalgetreueste Szene, allerdings in knapp 39 Minuten und für etwa 6,96 $ zum API-Tarif. GPT-6 Sol in Codex erfüllt ebenfalls alle dreizehn Punkte der Aufgabe in 5 Minuten für etwa 0,29 $, mit einer helleren und weniger stürmischen Szene. Beide Szenen laufen direkt im Artikel.

Am 22. September 2026 hat Anthropic Claude Opus 5.5 veröffentlicht und OpenAI GPT-6 Sol, am selben Tag. Noch am selben Abend habe ich beiden die Aufgabe unseres ersten Duells gestellt: ein Fischerboot, das nachts in einen Sturm gerät, in 3D, auf einer einfachen Webseite.

Jedes Modell arbeitet im Programmierassistenten seines Anbieters, Claude Code für Opus 5.5 und Codex für GPT-6 Sol. Diese Assistenten antworten nicht nur in einem Chatfenster. Sie schreiben Dateien auf den Rechner, führen Befehle aus und lesen ihre eigene Arbeit noch einmal durch. Die beiden gelieferten Szenen laufen weiter unten, direkt in deinem Browser. Klicke auf „Alle ausführen“, oder öffne die Vollbildansicht, um sie nebeneinander zu sehen.

Vollbildansicht

Même consigne qu'au premier duel du 7 septembre : un voilier de pêche dans une tempête de nuit, en 3D, dans une seule page web. Un seul passage, aucune retouche, et les deux scènes livrées s'exécutent ici, dans une sandbox, sur votre machine.

Gemeinsamer Prompt
code
Crée une scène 3D en three.js, dans un seul fichier index.html autonome, sans build ni dépendance locale (three.js chargé depuis un CDN par import map en module ES, version r170 ou plus récente).

Sujet : un voilier de pêche navigue de nuit sur une mer agitée, en pleine tempête.
- Mer : surface animée avec des vagues (déplacement de vertex), reflets sombres, écume discrète sur les crêtes si possible.
- Ciel : nuit noire, nuages bas, pluie visible (particules) poussée par le vent.
- Éclairs : toutes les quelques secondes, un éclair illumine brièvement toute la scène (flash, fort contraste, silhouette des nuages), avec un délai aléatoire entre deux éclairs.
- Bateau : coque, pont, mât, gréement et voile, modélisés uniquement avec des primitives three.js (aucun modèle externe, aucune texture externe). Il tangue et roule en suivant les vagues.
- Lanternes : au moins trois lanternes accrochées au bateau, lumière chaude et vacillante, qui éclairent le pont et l'eau autour du bateau.
- Caméra : contrôles orbitaux (OrbitControls) avec une position de départ qui met le bateau en valeur.
- Performance : viser 60 images par seconde sur un ordinateur portable ; le redimensionnement de la fenêtre est géré.
- Interface : aucune, à part un petit texte discret en bas à gauche indiquant les commandes.

Contraintes : tout le code (HTML, CSS, JavaScript) dans index.html ; pas de fichiers supplémentaires ; le fichier doit fonctionner en l'ouvrant directement dans un navigateur moderne (Chrome, Firefox, Safari). Ne pose pas de question, livre le fichier complet.
Protokoll

La même consigne, en français, que lors du premier duel du 7 septembre 2026, envoyée telle quelle aux deux IA le 22 septembre 2026, jour de leur sortie, sans échange ensuite ni retouche du résultat. Claude Code avec le modèle Claude Opus 5.5 et Codex avec le modèle GPT-6 Sol, tous deux réglés sur le niveau de réflexion « xhigh », comme au premier duel. Chaque IA a travaillé seule, dans un dossier vide, avec ses réglages d'origine et dans sa sandbox : elle pouvait écrire dans son dossier et chercher sur le web, mais ni sortir de ce dossier ni ouvrir un navigateur. Aucune des deux n'a donc vu sa scène avant de la rendre. Mesures : temps de travail, coût au tarif public de l'API, respect point par point de la consigne, erreurs au chargement, rendu dans Chrome en 1 280 × 720, fluidité sans carte graphique puis sur une carte graphique récente, sans limite d'images par seconde, et fluidité sur votre machine dans ce banc.

AClaude Code · Claude Opus 5.5Claude Opus 5.5 (xhigh)Gewinner

Läuft in einer isolierten Sandbox (iframe sandbox und CSP): kein Zugriff auf die Website, Cookies oder Ihre Sitzung. Vor Ihrem Klick wird nichts geladen.

HerunterladenSeparat öffnen
Anbieter
Anthropic
Modell
Claude Opus 5.5 (xhigh)
Werkzeug
Claude Code
Datum
2026-09-22
Dauer
38 min 39 s
Kosten
≈ 6,96 $ au tarif de l'API (payé par l'abonnement Claude)
Dateigröße
42 KB
BCodex · GPT-6 SolGPT-6 Sol (xhigh)

Läuft in einer isolierten Sandbox (iframe sandbox und CSP): kein Zugriff auf die Website, Cookies oder Ihre Sitzung. Vor Ihrem Klick wird nichts geladen.

HerunterladenSeparat öffnen
Anbieter
OpenAI
Modell
GPT-6 Sol (xhigh)
Werkzeug
Codex
Datum
2026-09-22
Dauer
5 min 03 s
Kosten
≈ 0,29 $ au tarif de l'API (payé par l'abonnement ChatGPT)
Dateigröße
20 KB
MessungenA · Claude Code · Claude Opus 5.5B · Codex · GPT-6 Sol
Temps de travail38 min 39 s5 min 03 s
Coût au tarif public de l'API≈ 6,96 $≈ 0,29 $
Points de la consigne respectés13 sur 1313 sur 13
Erreurs au chargement00
Poids de la page42 Ko20 Ko
Bateaubateau de pêche à deux mâts, voiles tannéesvoilier de plaisance à un mât
Lanternes4, dont 3 qui se balancent3
Images par seconde sans carte graphique (rendu logiciel, sans limite)1636
Images par seconde sur carte graphique récente (Apple M5 Pro, sans limite)753327

Fazit

Claude Opus 5.5 livre la tempête la plus fidèle : un bateau de pêche à deux mâts et voiles tannées, une mer noire qui se creuse en houle, des embruns à l'avant, quatre lanternes dont trois se balancent, et des éclairs qui découpent la silhouette des nuages. Il lui a fallu près de 39 minutes et environ 6,96 $ au tarif de l'API. GPT-6 Sol remplit aussi les treize points de la consigne, en 5 minutes et pour environ 0,29 $, avec une scène plus claire et plus calme : un voilier de plaisance, des nuages en facettes et une mer qui blanchit d'un coup sous l'éclair. La meilleure scène d'un côté, près de huit fois plus vite et vingt-quatre fois moins cher de l'autre.

Zwei Modelle, am selben Tag veröffentlicht

Anthropic stellt Claude Opus 5.5 als ein Modell auf dem Niveau von Claude Fable 5.1 bei den meisten Aufgaben vor, 40 % günstiger im Betrieb als Opus 5. Die Ankündigung vom 22. September zitiert sogar einen Tester, der mehrere Claude-Modelle anhand einer einzigen Aufgabenstellung ein Spiel bauen ließ: Opus 5.5 erhielt die beste Note für Grafik und Feinschliff.

Bei OpenAI übernimmt GPT-6 Sol die Fortschritte von GPT-6 Astra in einem schnelleren und günstigeren Modell. Die am 22. September im Entwicklerforum von OpenAI veröffentlichte Ankündigung macht es in Codex für die Abonnements Plus, Pro, Business, Enterprise und Edu verfügbar, mit API-Preisen, die gegenüber den Aktionspreisen von GPT-5.6 halbiert wurden. 9to5Mac beschreibt es als das Modell für komplexe Programmieraufgaben, im Gegensatz zu GPT-6 Luna, das für gezieltere, in großem Umfang wiederholte Aufgaben gedacht ist.

Die Aufgabe, wortgleich mit dem ersten Duell

Die Anfrage passt auf eine Seite. Sie verlangt eine Szene in three.js, einer kostenlosen Bibliothek zum Zeichnen von 3D-Grafik in einer Webseite, geliefert in einer einzigen Datei, die sich in jedem Browser öffnen lässt. Das Thema: ein Fischerboot, das nachts bei starkem Seegang mitten in einem Sturm unterwegs ist.

Es folgen dreizehn Anforderungen. Ein bewegtes Meer, Schaum auf den Wellenkämmen, eine tiefschwarze Nacht, tiefhängende Wolken, vom Wind getriebener Regen und Blitze in unregelmäßigen Abständen. Ein Boot, gebaut nur aus einfachen Grundformen (Würfel, Zylinder, Kugeln), das mit den Wellen stampft und rollt, und mindestens drei Laternen mit flackerndem Licht. Dazu eine Kamera, die sich mit der Maus drehen lässt, ein Fenster, dessen Größe sich ändern lässt, ein kurzer Hilfetext und eine einzige Datei. Die vollständige Aufgabenstellung steht im Benchmark unter „Gemeinsamer Prompt“.

Gleiche Einstellung, gleiche Sandbox, ein einziger Versuch

Am 7. September stellte unser erster Vergleich von Claude Code und Codex Claude Fable 5.1 und GPT-6 Astra bei genau derselben Aufgabe gegenüber. Ich habe die gleichen Regeln übernommen: ein einziger Versuch, keine Nachbesserung, und auf beiden Seiten dasselbe Reflexionsniveau, „xhigh“.

Diese Einstellung legt fest, wie viel Zeit die KI vor und während ihrer Arbeit zum Nachdenken bekommt, ähnlich der Vorbereitungszeit, die ein Kandidat vor einer mündlichen Prüfung erhält. „xhigh“ ist die Stufe direkt unter dem Maximum. Jeder Anbieter gestaltet seine eigene Skala, sodass dasselbe Wort bei Anthropic und bei OpenAI nicht dieselbe Menge an Nachdenken garantiert.

Jede KI hat allein gearbeitet, in einem leeren Ordner, mit ihren Standardeinstellungen und in ihrer Sandbox, einem geschlossenen Raum, in dem sie in ihrem Ordner schreiben und im Web suchen kann, ohne den Rest des Rechners zu berühren. Unser Artikel über die Sandbox von Claude Code und Codex erklärt im Detail, was sie blockiert. Hier untersagte sie das Öffnen eines Browsers: Keine der beiden KIs konnte ihre Szene ansehen, bevor sie sie ablieferte.

Claude Opus 5.5 hat ein echtes Fischerboot gebaut

Opus 5.5 lieferte ein zweimastiges Fischerboot mit gegerbten, ziegelroten Segeln, wie sie alte Arbeitsboote trugen. Der dunkle Rumpf zeigt eine helle Wasserlinie. An Deck finden sich eine Kajüte mit beleuchteten Bullaugen, ein Rettungsring, Netze, orangefarbene Bojen, Kisten und aufgerollte Taue. Die Deckplanken und der Stoff der Segel werden vom Code selbst gezeichnet, ganz ohne von außen geladenes Bild.

Das Meer ist eine tiefe Dünung, die sich so stark auftürmt, dass sie den Rumpf zeitweise verdeckt. Sie zieht unter dem Boot dahin, das dadurch vorwärts zu fahren scheint, mit Schaum auf den Kämmen, an der Bordwand und im Kielwasser. Gischt spritzt auf, wenn der Bug in eine Welle eintaucht. Vier Laternen beleuchten das Deck, drei davon hängen und schaukeln im Takt des Schlingerns.

Wenn kein Blitz zuckt, ist die Nacht wirklich schwarz. Man erahnt das Boot an seinen Laternen, seinen Bullaugen und deren Lichtreflexen, die auf dem Wasser glitzern, unter einem dichten Regen aus 16.000 Strichen, die sich in der Nähe der Laternen orange färben. Jeder Blitz besteht aus zwei bis vier dicht aufeinanderfolgenden Aufblitzen. Er erhellt den Himmel hinter den Wolken, zeichnet deren Umriss nach, zeigt schlagartig die Höhe der Wellen, und in einem von fünf Fällen bleibt er in den Wolken verborgen.

GPT-6 Sol, eine hellere und ruhigere Szene

GPT-6 Sol baute ein einmastiges Segelboot mit hellem Rumpf und Holzdeck, mit einer kleinen Kajüte mit beleuchteten Fenstern, Fässern, Kisten und einer roten Flagge, die im Wind flattert. Drei Laternen beleuchten das Deck und zeichnen warme Lichtflecken auf das Wasser. Zwei blasse Streifen markieren sein Kielwasser.

Der Himmel ist schwarz, aber das Meer, in einem leuchtenden Blaugrün, wirft viel Licht zurück, und die Wellen bleiben klein. Die Szene ist von der ersten Sekunde an gut lesbar, mehr mit dem Charakter eines Ausflugs aufs Meer an einem regnerischen Abend als mit dem eines Sturms. Die tiefhängenden Wolken bestehen aus großen, facettierten Blöcken. Wenn der Blitz einschlägt, erscheint ein gezackter Bogen am Horizont und das ganze Meer wird schlagartig weiß.

Beide Dateien erfüllen alle dreizehn Punkte der Aufgabe, ohne einen einzigen Fehler beim Laden. Der Unterschied liegt in der Interpretation: Opus 5.5 nahm „Fischerboot“ und „Sturm“ wörtlich, GPT-6 Sol lieferte eine zurückhaltendere und leichter anzusehende Szene.

Neununddreißig Minuten gegen fünf

GPT-6 Sol lieferte seine Datei nach 5 Minuten ab. Opus 5.5 überlegte fast eine halbe Stunde, bevor es die erste Zeile schrieb, baute dann seine Seite Stück für Stück und las sie anschließend rund zehn Minuten lang noch einmal durch und korrigierte sie, insgesamt 38 Minuten und 39 Sekunden.

Zum öffentlichen API-Tarif, dem Preis, den Entwickler zahlen, die ein Modell in ihre eigenen Programme einbinden, würde der Durchlauf von Opus 5.5 etwa 6,96 Dollar kosten und der von GPT-6 Sol etwa 0,29 Dollar. Bezahlt wurden beide über ein Abonnement, Claude auf der einen und ChatGPT auf der anderen Seite, das solche Durchläufe in ein Kontingent statt in Dollar verrechnet.

Der Unterschied liegt nicht am angegebenen Preis. Anthropic berechnet Opus 5.5 zweieinhalbmal günstiger als Fable 5.1, aber bei dieser Aufgabe erzeugte es fast fünfmal so viel Text wie Fable 5.1 beim ersten Duell, und fast sechzehnmal so viel wie GPT-6 Sol. Der größte Teil dieses Textes ist ein Denkentwurf, den niemand liest, der aber bezahlt wird. Am 7. September hatte Fable 5.1 20,5 Minuten gebraucht und GPT-6 Astra 13,5 Minuten, für etwa 4,70 und 2,20 Dollar. GPT-6 Sol erledigt die gleiche Arbeit also fast dreimal so schnell und fast achtmal so günstig wie sein Vorgänger, während Opus 5.5 bei diesem Sturm teurer war als Fable 5.1.

Flüssig auf einem aktuellen Mac, langsamer ohne Grafikkarte

Auf einem Rechner ohne Grafikkarte zeichnet der Prozessor alles, wie ein Maler allein vor seiner Leinwand. Unter diesen Bedingungen zeigt die Szene von GPT-6 Sol 36 Bilder pro Sekunde, die von Opus 5.5 nur 16 (ein Kinofilm zeigt 24). Eine aktuelle Grafikkarte gleicht eher einer Werkstatt mit Tausenden kleinen Händen, die gleichzeitig malen, und dort kehrt sich die Reihenfolge um: 753 Bilder pro Sekunde für Opus 5.5 gegenüber 327 für GPT-6 Sol, gemessen ohne Begrenzung auf einem Mac mit M5-Pro-Chip.

Opus 5.5 überlässt fast die gesamte Arbeit der Grafikkarte, bis hin zu den Regentropfen. GPT-6 Sol berechnet Meer und Regen bei jedem Bild neu auf dem Prozessor. Auf einem aktuellen Rechner liegen beide Szenen deutlich über den geforderten 60 Bildern pro Sekunde, und der Benchmark misst die Flüssigkeit auf deinem eigenen Rechner.

Welches wählen?

  • Für eine Szene, die sich eng an die Aufgabe hält und auf Anhieb Eindruck macht, Claude Opus 5.5, mit einer Planung von rund vierzig Minuten und ein paar Dollar pro Versuch.
  • Um schnell und oft auszuprobieren, GPT-6 Sol: fünf Minuten und ein paar Cent pro Versuch, notfalls mit der Nachfrage nach einem dunkleren Meer und einem echten Fischerboot. Bei längeren Projekten, Nachricht für Nachricht angeleitet, hat Codex bereits einen von Dune 2000 inspirierten Spielprototyp gebaut.
  • Um selbst zu vergleichen, denk daran, dass bei jedem Versuch ein Teil der Entscheidungen der KI ausgewürfelt wird. Morgen erneut gestartet, würde dieselbe Aufgabe zwei andere Szenen ergeben. Der Benchmark hält deshalb die Aufgabe und beide Dateien online bereit, die du herunterladen und erneut ausführen kannst.

Das Wichtigste in Kürze

  • Gleiche Aufgabe, gleiche Einstellung, ein einziger Versuch: Claude Opus 5.5 und GPT-6 Sol erfüllen jeweils alle dreizehn Anforderungen, ohne Fehler beim Laden.
  • Claude Opus 5.5 liefert den originalgetreuesten Sturm, mit einem echten Fischerboot, Gischt und Blitzen, die die Wolken durchzeichnen, in knapp 39 Minuten und für etwa 6,96 Dollar zum API-Tarif.
  • GPT-6 Sol liefert eine hellere und ruhigere Szene in 5 Minuten, für etwa 0,29 Dollar.
  • Ohne Grafikkarte läuft die Szene von GPT-6 Sol am flüssigsten. Auf einer aktuellen Grafikkarte ist es die von Opus 5.5.
  • Keine der beiden KIs hat ihre Szene gesehen, bevor sie sie ablieferte, und dieses Urteil beruht auf jeweils nur einem einzigen Versuch, am 22. September 2026.

BenchmarkClaude CodeClaude Opus 5.5CodexGPT-6 Solthree.js

Damien Flandrin Webentwickler seit 2010, Gründer von Gekkode und Email Impact. Jeder Artikel wird vor der Veröffentlichung an einem echten Projekt getestet. Kontakt
Newsletter

Neue Tests, Tutorials und Projekte, per E-Mail.

Reproduzierbare Tests, versionierter Code, datierte Ergebnisse. Niemals Spam.