MentalHealthBench, OpenAI

MentalHealthBench: OpenAI prüft KI-Antworten mit 1.215 Gesprächen

Veröffentlicht am: 24.09.2026 um 11:32 Uhr | Redaktion boerse-global.de

Der offene Datensatz vergleicht KI-Antworten in psychischen Gesundheitsgesprächen; GPT-6 Astra erzielt insgesamt 57,3 Prozent.

OpenAI veröffentlicht MentalHealthBench für KI-Tests zur mentalen Gesundheit
Ein minimalistischer, ruhiger Raum mit natürlichem Licht, das sanfte Schatten auf eine schlichte Holztischoberfläche wirft. Illustration mit AI erstellt.

In einem Bericht vom 23. September 2026 hat OpenAI die Einführung von MentalHealthBench bekannt gegeben. Dabei handelt es sich um einen offenen Benchmark, der speziell dafür entwickelt wurde, die Antworten von Künstlicher Intelligenz in realistischen Gesprächen über mentale Gesundheit zu bewerten.

Das System entstand in Zusammenarbeit mit über 80 lizenzierten Experten aus 22 Ländern, die 19 Sprachen und rund 20 medizinische Subspezialitäten repräsentieren.

Methodik und Aufbau des Datensatzes

Der Benchmark umfasst laut Unternehmensangaben 1.215 synthetisch erzeugte Gespräche zur mentalen Gesundheit sowie 5.262 von Experten erstellte Bewertungskriterien. Die Prüfung der Konversationen erfolgte in einem dreistufigen Prozess, an dem pro Dialog mindestens drei Fachleute beteiligt waren.

Ein Kriterium wurde nur dann in das System aufgenommen, wenn zwei Experten zustimmten und der dritte keinen Widerspruch einlegte. Die Gewichtung der Kriterien reicht dabei von -10 bis +10.

Die Szenarien innerhalb des Benchmarks sind in verschiedene Dringlichkeitsstufen unterteilt. Den größten Anteil bilden mit 53,5 % nicht-akute Alltagsgespräche. 28,3 % der Szenarien betreffen Notfälle mit unmittelbarer Sicherheitsgefährdung, während 18,2 % auf Gespräche mit schweren psychischen Problemen entfallen.

Bei der Verteilung der Nutzerprofile liegt der Schwerpunkt mit 68,1 % auf Erwachsenen, gefolgt von Teenagern mit 21,2 %. Ein kleinerer Teil entfällt auf klinisches Personal (5,8 %) und pflegende Angehörige (4,9 %). In 5,8 % der Aufgaben ist zudem ein vorheriger Nutzerkontext enthalten.

Sprachliche Vielfalt und technische Evaluierung

MentalHealthBench deckt ein breites sprachliches Spektrum ab. Neben englischen Inhalten umfasst der Datensatz 105 spanische, 54 hindi-sprachige, 34 arabische und 29 portugiesische Gespräche. Weitere Beispiele liegen in Deutsch, Italienisch, Persisch, Indonesisch, Türkisch und Chinesisch vor. Für die Bewertung der Jugendbeispiele wurden zudem 30 Kliniker herangezogen, die über spezifische Erfahrung in der Behandlung von unter 18-Jährigen verfügen.

Als automatisches Bewertungsinstrument dient laut den Berichten vom 23. September 2026 das Modell GPT-5.6 Sol im sogenannten High-Reasoning-Modus. Dieses führt pro Aufgabe vier unabhängig voneinander erzeugte Vervollständigungen aus. Bewertet werden hierbei die Sicherheit der Antworten, die Kontexterfassung, die Wahrung der Nutzerautonomie sowie die Bereitstellung handlungsorientierter Beratung.

Anzeige

Der neue offene Benchmark zeigt, wie unterschiedlich aktuelle KI-Modelle in Mental-Health-Gesprächen abschneiden — Spitzenwerte liegen bei 57,3 %, ältere Modelle fallen auf unter 30 % zurück. Wer KI in Gesundheitsprodukten einsetzt, braucht jetzt belastbare Prüfkriterien statt Bauchgefühl. Unser kostenloser Leitfaden fasst die relevanten Sicherheits- und Compliance-Schritte zusammen. Compliance-Leitfaden jetzt anfordern

Ergebnisse im Leistungsvergleich der Frontier-Modelle

Die Auswertung zeigt deutliche Leistungsunterschiede zwischen aktuellen KI-Modellen. GPT-6 Astra erreichte mit 57,3 % den höchsten Gesamtwert und erzielte in Notfall-Dialogen eine Quote von 58,3 %. GPT-6 Sol folgte mit 53,9 %, während Claude Opus 5.5 auf 52,4 % kam.

Letzteres Modell zeigte mit 57,0 % eine besondere Stärke bei Dialogen mit Jugendlichen. Das Modell GPT-6 Luna erreichte 50,2 %. Im Vergleich dazu schnitten ältere oder andere Modelle schwächer ab: GPT-4o (Stand März 2025) kam auf 32,1 % und Gemini 2.5 Pro auf 29,5 %.

Es wurde festgestellt, dass Vervollständigungen, die die spezifischen Rubriken berücksichtigen, Werte von bis zu 99,0 % erreichen können. Von Klinikern geführte Interaktionen lagen bei 38,5 %.

Diskrepanzen zwischen Nutzer- und Expertenbewertungen

Eine begleitende Studie mit 44 Erwachsenen aus 16 Ländern und 14 Sprachen untersuchte die Übereinstimmung zwischen Laien und Fachpersonal. Dabei zeigte sich eine Deckungsgleichheit von 25,7 % bei den Bewertungsgewichten, während 1,0 % der Kriterien direkt widersprüchlich beurteilt wurden.

Während Nutzer vor allem praktische nächste Schritte und den gewählten Tonfall schätzten, betonten Kliniker die Bedeutung der Kontexterfassung und die Interpretation mehrdeutiger Situationen.

Anzeige

In 28,3 % der Benchmark-Szenarien geht es um Notfälle mit unmittelbarer Sicherheitsgefährdung — und selbst führende Modelle erreichen dort nur rund 58 %. Wenn Ihr Produkt in solchen Momenten antwortet, entscheidet die Prüflogik über Haftung und Nutzervertrauen. Der Leitfaden zeigt, wie Sie Notfall-Erkennung, Kontexterfassung und Autonomiewahrung systematisch testen. Prüf-Checkliste für Krisen-Dialoge sichern

Der CEO der American Psychological Association (APA) wies in diesem Zusammenhang darauf hin, dass mentale Gesundheit auf einem Kontinuum existiere. OpenAI betonte zudem, dass ChatGPT zwar wöchentlich von über einer Milliarde Menschen genutzt werde, jedoch keinen Ersatz für eine professionelle Therapie darstelle.

Der nun veröffentlichte Datensatz ist für Forscher herunterladbar, eine direkte Online-Veröffentlichung der Inhalte ist jedoch nicht vorgesehen. Begleitet wird die Initiative durch weitere Projekte wie ChatGPT for Teens und Kooperationen mit Organisationen wie Transluce oder lokalen Krisenhotlines.

Disclaimer...

de | wissenschaft | 70176604 |