
Bei derselben Aufgabe in 3D, ein Fischerboot in einem nächtlichen Sturm, liefert Claude Opus 5.5 in Claude Code die originalgetreueste Szene, allerdings in knapp 39 Minuten und für etwa 6,96 $ zum API-Tarif. GPT-6 Sol in Codex erfüllt ebenfalls alle dreizehn Punkte der Aufgabe in 5 Minuten für etwa 0,29 $, mit einer helleren und weniger stürmischen Szene. Beide Szenen laufen direkt im Artikel.
Am 22. September 2026 hat Anthropic Claude Opus 5.5 veröffentlicht und OpenAI GPT-6 Sol, am selben Tag. Noch am selben Abend habe ich beiden die Aufgabe unseres ersten Duells gestellt: ein Fischerboot, das nachts in einen Sturm gerät, in 3D, auf einer einfachen Webseite.
Jedes Modell arbeitet im Programmierassistenten seines Anbieters, Claude Code für Opus 5.5 und Codex für GPT-6 Sol. Diese Assistenten antworten nicht nur in einem Chatfenster. Sie schreiben Dateien auf den Rechner, führen Befehle aus und lesen ihre eigene Arbeit noch einmal durch. Die beiden gelieferten Szenen laufen weiter unten, direkt in deinem Browser. Klicke auf „Alle ausführen“, oder öffne die Vollbildansicht, um sie nebeneinander zu sehen.
Même consigne qu'au premier duel du 7 septembre : un voilier de pêche dans une tempête de nuit, en 3D, dans une seule page web. Un seul passage, aucune retouche, et les deux scènes livrées s'exécutent ici, dans une sandbox, sur votre machine.
Gemeinsamer Prompt
Crée une scène 3D en three.js, dans un seul fichier index.html autonome, sans build ni dépendance locale (three.js chargé depuis un CDN par import map en module ES, version r170 ou plus récente).
Sujet : un voilier de pêche navigue de nuit sur une mer agitée, en pleine tempête.
- Mer : surface animée avec des vagues (déplacement de vertex), reflets sombres, écume discrète sur les crêtes si possible.
- Ciel : nuit noire, nuages bas, pluie visible (particules) poussée par le vent.
- Éclairs : toutes les quelques secondes, un éclair illumine brièvement toute la scène (flash, fort contraste, silhouette des nuages), avec un délai aléatoire entre deux éclairs.
- Bateau : coque, pont, mât, gréement et voile, modélisés uniquement avec des primitives three.js (aucun modèle externe, aucune texture externe). Il tangue et roule en suivant les vagues.
- Lanternes : au moins trois lanternes accrochées au bateau, lumière chaude et vacillante, qui éclairent le pont et l'eau autour du bateau.
- Caméra : contrôles orbitaux (OrbitControls) avec une position de départ qui met le bateau en valeur.
- Performance : viser 60 images par seconde sur un ordinateur portable ; le redimensionnement de la fenêtre est géré.
- Interface : aucune, à part un petit texte discret en bas à gauche indiquant les commandes.
Contraintes : tout le code (HTML, CSS, JavaScript) dans index.html ; pas de fichiers supplémentaires ; le fichier doit fonctionner en l'ouvrant directement dans un navigateur moderne (Chrome, Firefox, Safari). Ne pose pas de question, livre le fichier complet.
Protokoll
La même consigne, en français, que lors du premier duel du 7 septembre 2026, envoyée telle quelle aux deux IA le 22 septembre 2026, jour de leur sortie, sans échange ensuite ni retouche du résultat. Claude Code avec le modèle Claude Opus 5.5 et Codex avec le modèle GPT-6 Sol, tous deux réglés sur le niveau de réflexion « xhigh », comme au premier duel. Chaque IA a travaillé seule, dans un dossier vide, avec ses réglages d'origine et dans sa sandbox : elle pouvait écrire dans son dossier et chercher sur le web, mais ni sortir de ce dossier ni ouvrir un navigateur. Aucune des deux n'a donc vu sa scène avant de la rendre. Mesures : temps de travail, coût au tarif public de l'API, respect point par point de la consigne, erreurs au chargement, rendu dans Chrome en 1 280 × 720, fluidité sans carte graphique puis sur une carte graphique récente, sans limite d'images par seconde, et fluidité sur votre machine dans ce banc.
Läuft in einer isolierten Sandbox (iframe sandbox und CSP): kein Zugriff auf die Website, Cookies oder Ihre Sitzung. Vor Ihrem Klick wird nichts geladen.
Läuft in einer isolierten Sandbox (iframe sandbox und CSP): kein Zugriff auf die Website, Cookies oder Ihre Sitzung. Vor Ihrem Klick wird nichts geladen.
| Messungen | A · Claude Code · Claude Opus 5.5 | B · Codex · GPT-6 Sol |
|---|---|---|
| Temps de travail | 38 min 39 s | 5 min 03 s |
| Coût au tarif public de l'API | ≈ 6,96 $ | ≈ 0,29 $ |
| Points de la consigne respectés | 13 sur 13 | 13 sur 13 |
| Erreurs au chargement | 0 | 0 |
| Poids de la page | 42 Ko | 20 Ko |
| Bateau | bateau de pêche à deux mâts, voiles tannées | voilier de plaisance à un mât |
| Lanternes | 4, dont 3 qui se balancent | 3 |
| Images par seconde sans carte graphique (rendu logiciel, sans limite) | 16 | 36 |
| Images par seconde sur carte graphique récente (Apple M5 Pro, sans limite) | 753 | 327 |
Fazit
Claude Opus 5.5 livre la tempête la plus fidèle : un bateau de pêche à deux mâts et voiles tannées, une mer noire qui se creuse en houle, des embruns à l'avant, quatre lanternes dont trois se balancent, et des éclairs qui découpent la silhouette des nuages. Il lui a fallu près de 39 minutes et environ 6,96 $ au tarif de l'API. GPT-6 Sol remplit aussi les treize points de la consigne, en 5 minutes et pour environ 0,29 $, avec une scène plus claire et plus calme : un voilier de plaisance, des nuages en facettes et une mer qui blanchit d'un coup sous l'éclair. La meilleure scène d'un côté, près de huit fois plus vite et vingt-quatre fois moins cher de l'autre.
Zwei Modelle, am selben Tag veröffentlicht
Anthropic stellt Claude Opus 5.5 als ein Modell auf dem Niveau von Claude Fable 5.1 bei den meisten Aufgaben vor, 40 % günstiger im Betrieb als Opus 5. Die Ankündigung vom 22. September zitiert sogar einen Tester, der mehrere Claude-Modelle anhand einer einzigen Aufgabenstellung ein Spiel bauen ließ: Opus 5.5 erhielt die beste Note für Grafik und Feinschliff.
Bei OpenAI übernimmt GPT-6 Sol die Fortschritte von GPT-6 Astra in einem schnelleren und günstigeren Modell. Die am 22. September im Entwicklerforum von OpenAI veröffentlichte Ankündigung macht es in Codex für die Abonnements Plus, Pro, Business, Enterprise und Edu verfügbar, mit API-Preisen, die gegenüber den Aktionspreisen von GPT-5.6 halbiert wurden. 9to5Mac beschreibt es als das Modell für komplexe Programmieraufgaben, im Gegensatz zu GPT-6 Luna, das für gezieltere, in großem Umfang wiederholte Aufgaben gedacht ist.
Die Aufgabe, wortgleich mit dem ersten Duell
Die Anfrage passt auf eine Seite. Sie verlangt eine Szene in three.js, einer kostenlosen Bibliothek zum Zeichnen von 3D-Grafik in einer Webseite, geliefert in einer einzigen Datei, die sich in jedem Browser öffnen lässt. Das Thema: ein Fischerboot, das nachts bei starkem Seegang mitten in einem Sturm unterwegs ist.
Es folgen dreizehn Anforderungen. Ein bewegtes Meer, Schaum auf den Wellenkämmen, eine tiefschwarze Nacht, tiefhängende Wolken, vom Wind getriebener Regen und Blitze in unregelmäßigen Abständen. Ein Boot, gebaut nur aus einfachen Grundformen (Würfel, Zylinder, Kugeln), das mit den Wellen stampft und rollt, und mindestens drei Laternen mit flackerndem Licht. Dazu eine Kamera, die sich mit der Maus drehen lässt, ein Fenster, dessen Größe sich ändern lässt, ein kurzer Hilfetext und eine einzige Datei. Die vollständige Aufgabenstellung steht im Benchmark unter „Gemeinsamer Prompt“.
Gleiche Einstellung, gleiche Sandbox, ein einziger Versuch
Am 7. September stellte unser erster Vergleich von Claude Code und Codex Claude Fable 5.1 und GPT-6 Astra bei genau derselben Aufgabe gegenüber. Ich habe die gleichen Regeln übernommen: ein einziger Versuch, keine Nachbesserung, und auf beiden Seiten dasselbe Reflexionsniveau, „xhigh“.
Diese Einstellung legt fest, wie viel Zeit die KI vor und während ihrer Arbeit zum Nachdenken bekommt, ähnlich der Vorbereitungszeit, die ein Kandidat vor einer mündlichen Prüfung erhält. „xhigh“ ist die Stufe direkt unter dem Maximum. Jeder Anbieter gestaltet seine eigene Skala, sodass dasselbe Wort bei Anthropic und bei OpenAI nicht dieselbe Menge an Nachdenken garantiert.
Jede KI hat allein gearbeitet, in einem leeren Ordner, mit ihren Standardeinstellungen und in ihrer Sandbox, einem geschlossenen Raum, in dem sie in ihrem Ordner schreiben und im Web suchen kann, ohne den Rest des Rechners zu berühren. Unser Artikel über die Sandbox von Claude Code und Codex erklärt im Detail, was sie blockiert. Hier untersagte sie das Öffnen eines Browsers: Keine der beiden KIs konnte ihre Szene ansehen, bevor sie sie ablieferte.
Claude Opus 5.5 hat ein echtes Fischerboot gebaut
Opus 5.5 lieferte ein zweimastiges Fischerboot mit gegerbten, ziegelroten Segeln, wie sie alte Arbeitsboote trugen. Der dunkle Rumpf zeigt eine helle Wasserlinie. An Deck finden sich eine Kajüte mit beleuchteten Bullaugen, ein Rettungsring, Netze, orangefarbene Bojen, Kisten und aufgerollte Taue. Die Deckplanken und der Stoff der Segel werden vom Code selbst gezeichnet, ganz ohne von außen geladenes Bild.
Das Meer ist eine tiefe Dünung, die sich so stark auftürmt, dass sie den Rumpf zeitweise verdeckt. Sie zieht unter dem Boot dahin, das dadurch vorwärts zu fahren scheint, mit Schaum auf den Kämmen, an der Bordwand und im Kielwasser. Gischt spritzt auf, wenn der Bug in eine Welle eintaucht. Vier Laternen beleuchten das Deck, drei davon hängen und schaukeln im Takt des Schlingerns.
Wenn kein Blitz zuckt, ist die Nacht wirklich schwarz. Man erahnt das Boot an seinen Laternen, seinen Bullaugen und deren Lichtreflexen, die auf dem Wasser glitzern, unter einem dichten Regen aus 16.000 Strichen, die sich in der Nähe der Laternen orange färben. Jeder Blitz besteht aus zwei bis vier dicht aufeinanderfolgenden Aufblitzen. Er erhellt den Himmel hinter den Wolken, zeichnet deren Umriss nach, zeigt schlagartig die Höhe der Wellen, und in einem von fünf Fällen bleibt er in den Wolken verborgen.
GPT-6 Sol, eine hellere und ruhigere Szene
GPT-6 Sol baute ein einmastiges Segelboot mit hellem Rumpf und Holzdeck, mit einer kleinen Kajüte mit beleuchteten Fenstern, Fässern, Kisten und einer roten Flagge, die im Wind flattert. Drei Laternen beleuchten das Deck und zeichnen warme Lichtflecken auf das Wasser. Zwei blasse Streifen markieren sein Kielwasser.
Der Himmel ist schwarz, aber das Meer, in einem leuchtenden Blaugrün, wirft viel Licht zurück, und die Wellen bleiben klein. Die Szene ist von der ersten Sekunde an gut lesbar, mehr mit dem Charakter eines Ausflugs aufs Meer an einem regnerischen Abend als mit dem eines Sturms. Die tiefhängenden Wolken bestehen aus großen, facettierten Blöcken. Wenn der Blitz einschlägt, erscheint ein gezackter Bogen am Horizont und das ganze Meer wird schlagartig weiß.
Beide Dateien erfüllen alle dreizehn Punkte der Aufgabe, ohne einen einzigen Fehler beim Laden. Der Unterschied liegt in der Interpretation: Opus 5.5 nahm „Fischerboot“ und „Sturm“ wörtlich, GPT-6 Sol lieferte eine zurückhaltendere und leichter anzusehende Szene.
Neununddreißig Minuten gegen fünf
GPT-6 Sol lieferte seine Datei nach 5 Minuten ab. Opus 5.5 überlegte fast eine halbe Stunde, bevor es die erste Zeile schrieb, baute dann seine Seite Stück für Stück und las sie anschließend rund zehn Minuten lang noch einmal durch und korrigierte sie, insgesamt 38 Minuten und 39 Sekunden.
Zum öffentlichen API-Tarif, dem Preis, den Entwickler zahlen, die ein Modell in ihre eigenen Programme einbinden, würde der Durchlauf von Opus 5.5 etwa 6,96 Dollar kosten und der von GPT-6 Sol etwa 0,29 Dollar. Bezahlt wurden beide über ein Abonnement, Claude auf der einen und ChatGPT auf der anderen Seite, das solche Durchläufe in ein Kontingent statt in Dollar verrechnet.
Der Unterschied liegt nicht am angegebenen Preis. Anthropic berechnet Opus 5.5 zweieinhalbmal günstiger als Fable 5.1, aber bei dieser Aufgabe erzeugte es fast fünfmal so viel Text wie Fable 5.1 beim ersten Duell, und fast sechzehnmal so viel wie GPT-6 Sol. Der größte Teil dieses Textes ist ein Denkentwurf, den niemand liest, der aber bezahlt wird. Am 7. September hatte Fable 5.1 20,5 Minuten gebraucht und GPT-6 Astra 13,5 Minuten, für etwa 4,70 und 2,20 Dollar. GPT-6 Sol erledigt die gleiche Arbeit also fast dreimal so schnell und fast achtmal so günstig wie sein Vorgänger, während Opus 5.5 bei diesem Sturm teurer war als Fable 5.1.
Flüssig auf einem aktuellen Mac, langsamer ohne Grafikkarte
Auf einem Rechner ohne Grafikkarte zeichnet der Prozessor alles, wie ein Maler allein vor seiner Leinwand. Unter diesen Bedingungen zeigt die Szene von GPT-6 Sol 36 Bilder pro Sekunde, die von Opus 5.5 nur 16 (ein Kinofilm zeigt 24). Eine aktuelle Grafikkarte gleicht eher einer Werkstatt mit Tausenden kleinen Händen, die gleichzeitig malen, und dort kehrt sich die Reihenfolge um: 753 Bilder pro Sekunde für Opus 5.5 gegenüber 327 für GPT-6 Sol, gemessen ohne Begrenzung auf einem Mac mit M5-Pro-Chip.
Opus 5.5 überlässt fast die gesamte Arbeit der Grafikkarte, bis hin zu den Regentropfen. GPT-6 Sol berechnet Meer und Regen bei jedem Bild neu auf dem Prozessor. Auf einem aktuellen Rechner liegen beide Szenen deutlich über den geforderten 60 Bildern pro Sekunde, und der Benchmark misst die Flüssigkeit auf deinem eigenen Rechner.
Welches wählen?
- Für eine Szene, die sich eng an die Aufgabe hält und auf Anhieb Eindruck macht, Claude Opus 5.5, mit einer Planung von rund vierzig Minuten und ein paar Dollar pro Versuch.
- Um schnell und oft auszuprobieren, GPT-6 Sol: fünf Minuten und ein paar Cent pro Versuch, notfalls mit der Nachfrage nach einem dunkleren Meer und einem echten Fischerboot. Bei längeren Projekten, Nachricht für Nachricht angeleitet, hat Codex bereits einen von Dune 2000 inspirierten Spielprototyp gebaut.
- Um selbst zu vergleichen, denk daran, dass bei jedem Versuch ein Teil der Entscheidungen der KI ausgewürfelt wird. Morgen erneut gestartet, würde dieselbe Aufgabe zwei andere Szenen ergeben. Der Benchmark hält deshalb die Aufgabe und beide Dateien online bereit, die du herunterladen und erneut ausführen kannst.
Das Wichtigste in Kürze
- Gleiche Aufgabe, gleiche Einstellung, ein einziger Versuch: Claude Opus 5.5 und GPT-6 Sol erfüllen jeweils alle dreizehn Anforderungen, ohne Fehler beim Laden.
- Claude Opus 5.5 liefert den originalgetreuesten Sturm, mit einem echten Fischerboot, Gischt und Blitzen, die die Wolken durchzeichnen, in knapp 39 Minuten und für etwa 6,96 Dollar zum API-Tarif.
- GPT-6 Sol liefert eine hellere und ruhigere Szene in 5 Minuten, für etwa 0,29 Dollar.
- Ohne Grafikkarte läuft die Szene von GPT-6 Sol am flüssigsten. Auf einer aktuellen Grafikkarte ist es die von Opus 5.5.
- Keine der beiden KIs hat ihre Szene gesehen, bevor sie sie ablieferte, und dieses Urteil beruht auf jeweils nur einem einzigen Versuch, am 22. September 2026.


