DrivingBench, GPT-6

DrivingBench: GPT-6 Astra fährt als einziges Modell den Kurs vollständig

Veröffentlicht am: 11.10.2026 um 02:48 Uhr | Redaktion boerse-global.de

Im DrivingBench-Versuch fuhr GPT-6 Astra die gesamte Strecke; die übrigen Sprachmodelle blieben unter der Hälfte.

DrivingBench: GPT-6 Astra meistert den Fahrtest mit einem Toyota Corolla
Eine leere, asphaltierte Teststrecke mit verblassten Fahrbahnmarkierungen auf einem weitläufigen, industriellen Gelände. Illustration mit AI erstellt.

Große Sprachmodelle werden zunehmend auf ihre Tauglichkeit außerhalb reiner Text- und Bildverarbeitungsaufgaben untersucht. Eine Untersuchung von Ingenieuren der Organisation Axiom liefert Einblicke in das Potenzial und die Grenzen moderner KI-Systeme bei der physischen Steuerung von Kraftfahrzeugen.

Im Rahmen des sogenannten DrivingBench-Experiments untersuchten Aditya Ramabadran, Simon Mahns und Tobias Gessler, wie sich universelle Modelle ohne vorbereitendes Fahrtraining in einer realen Fahrumgebung verhalten.

Versuchsaufbau mit Standard-Hardware auf dem Testgelände

Für das Experiment setzten die Axiom-Ingenieure einen serienmäßigen Toyota Corolla des Modelljahrs 2024 ein. Das Fahrzeug wurde ohne spezielle Robotik-Hardware gesteuert. Die technische Schnittstelle bildeten ein gewöhnliches Chat-Interface, ein Server, einfache Windschutzscheibenkameras sowie die Ansteuerung der elektrischen Servolenkung.

Der Versuchsaufbau fand auf einem abgesperrten, leeren Parkplatz statt. Auf diesem war ein 134,7 Meter langer Parkour markiert. Die Fahrgeschwindigkeit wurde softwareseitig auf rund 8 mph limitiert. Zur Absicherung befand sich stets ein menschlicher Sicherheitsfahrer an Bord, der den Fuß über dem Bremspedal hielt, jedoch nicht in die Lenkung eingriff.

Als Fortschritt definierten die Versuchsleiter die entlang der Mittellinie gefahrene Distanz, bei der das Fahrzeug innerhalb einer Toleranz von vier Metern verbleiben musste. Jedem Modell standen maximal drei Versuche innerhalb derselben Konversation zur Verfügung.

Anzeige

Wer sich mit dem technologischen Wandel befasst, erkennt schnell, dass KI und Robotik ganze Branchen umkrempeln. Dieser kostenlose Report fasst zusammen, wie diese Entwicklungen die Industrie verändern und welche Unternehmen davon profitieren. Experten-Analyse zur Industrierevolution herunterladen

Ergebnisse der Sprachmodelle im DrivingBench-Parkour

Im Test traten die Systeme GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol und Grok 4.6 an. Die Auswertung verdeutlicht die noch erheblichen Leistungsunterschiede: Von insgesamt elf dokumentierten Fahrversuchen scheiterten acht bereits vor dem Erreichen von 11 Prozent der Strecke.

GPT-6 Astra bewältigte als einziges Modell den vorgegebenen Kurs vollständig. Nach einem ersten Durchlauf mit 49 Prozent Streckenfortschritt erreichte das System im zweiten Versuch 100 Prozent der Mittellinie bei einer Fahrzeit von 5:22 Minuten. Diese über fünf Minuten dauernde Fahrt verursachte Token-Kosten in Höhe von 7,74 US-Dollar, was fast dem Vierfachen des ersten Versuchs entsprach.

Die weiteren getesteten Modelle blieben deutlich hinter diesem Ergebnis zurück:
- Claude Fable 5.1 erreichte im ersten Versuch 9 Prozent und steigerte sich im dritten Durchlauf auf 45 Prozent der Strecke.
- Grok 4.6 erzielte in drei Versuchen maximal 12 Prozent, während ein weiterer Durchlauf bei 11 Prozent endete.
- GPT-5.6 Sol kam in allen drei absolvierten Versuchen nicht über 6 Prozent hinaus.

Kein Durchlauf abseits von GPT-6 Astra überschritt die Marke von 50 Prozent. Zusätzlich steuerte GPT-6 Astra das Fahrzeug im kalifornischen Bay Area durch den Drive-Thru einer In-N-Out-Burger-Filiale und navigierte dabei bis zum Ausgabefenster, wie WIRED-Reporter Will Knight festhielt.

Anzeige

Robotik und Künstliche Intelligenz sind die Treiber der nächsten Industrieära und ziehen bereits Milliarden-Investitionen nach sich. Der aktuelle Gratis-Report liefert konkrete Einblicke in die Firmen, die hinter diesem massiven technologischen Umbruch stecken. Kostenlosen Report: Die nächste industrielle Revolution sichern

Methodische Hürden und Einordnung des Systemverhaltens

Vor dem Start traten funktionale Barrieren auf: Die Systeme verweigerten die Ausführung zunächst mit dem Hinweis, dass sie keine Bewegungsbefehle an ein physisches Kraftfahrzeug übermitteln könnten. Erst durch gezielte Eingabeaufforderungen ließen sich die Modelle zur Ausgabe von Steuerbefehlen bewegen.

Axiom-Ingenieur Aditya Ramabadran beobachtete, dass die Modelle über In-Context-Learning in der Lage waren, ihr Verhalten in Echtzeit an aufgetretene Fehler anzupassen.

Simon Mahns, ebenfalls Ingenieur bei Axiom, ordnete die Fahrfähigkeit als eine mögliche emergente Eigenschaft ein, die durch die Skalierung multimodaler Fähigkeiten entsteht. Das Axiom-Team veröffentlichte die Forschungsarbeit auf arXiv und stellte die Testumgebung, Prompts, Streckenkarten sowie Trajektorien öffentlich zur Verfügung.

Die Notwendigkeit verbesserter visueller Schlussfolgerungen für die Robotik betonte auch Andrew Dai, CEO von Elorian AI. Gemeinsam mit Scale AI entwickelte das Unternehmen das Benchmark-Verfahren Humanity's Sixth Sense. Xingang Guo von Scale AI erklärte dazu, Ziel des Verfahrens sei es zu überprüfen, ob KI-Modelle visuelle Szenen intuitiv erfassen und verstehen können.

Disclaimer...

de | wissenschaft | 70290763 |