Gemini Flash TTS: Google ermöglicht Stimmenklon mit 30 Sekunden Audio
Veröffentlicht am: 23.09.2026 um 18:33 Uhr | Redaktion boerse-global.de
Google erweitert sein Angebot an generativen Audiomodellen und hat Gemini 3.8 Flash TTS sowie Flash-Lite TTS vorgestellt. Während Flash TTS speziell für die kreative Sprachgestaltung konzipiert ist, zielt Flash-Lite TTS auf kosteneffiziente Anwendungen bei hohem Verarbeitungsvolumen ab. Die neuen Modelle stehen Entwicklern über die Gemini API sowie in Google AI Studio zur Verfügung.
Umfangreiche Sprachbibliothek und Replikation
Das Modell Gemini 3.8 Flash TTS bietet nach Unternehmensangaben weitreichende Möglichkeiten zur individuellen Sprachgestaltung in über 100 Sprachen und Dialekten. Entwicklern steht hierbei eine Bibliothek mit mehr als 2.000 vordefinierten Stimmen zur Auswahl.
Darüber hinaus ermöglicht Flash TTS die Replikation menschlicher Stimmen. Für diesen Klonprozess genügt eine Audioaufnahme mit einer Länge von 30 Sekunden. Um Missbrauch vorzubeugen, setzt Google nach Berichten auf integrierte Sicherheitsmechanismen: Dazu gehören eine Überprüfung der Zustimmung der Betroffenen sowie die Kennzeichnung des generierten Materials mittels der Wasserzeichen-Technologie SynthID und dem C2PA-Standard.
Leistungsdaten und technische Spezifikationen
In internen und externen Vergleichsmessungen platziert Google die Neuentwicklungen an der Spitze der aktuellen Sprachmodelle. Nach Angaben des Konzerns erzielte Flash TTS einen Wert von 71,4 im Hume Voice Design Benchmark und erreichte bei der Akzentmodellierung ein Ergebnis von 60,8. Im Hume Overall Quality Index belegten Flash TTS und Flash-Lite TTS den ersten und zweiten Platz.
Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun? Die EU-KI-Verordnung stellt neue Regeln auf, die viele noch nicht kennen – dieser kostenlose Report klärt auf. EU AI Act Umsetzungsleitfaden jetzt kostenlos herunterladen
Technisch verarbeiten beide Systeme umfangreiche Kontexte: Die Modelle unterstützen Eingaben von bis zu 8.000 Tokens und können Audioausgaben mit einem Umfang von bis zu 64.000 Tokens erzeugen. Auch für spätere Ausgaben bleibt die SynthID-Markierung als fester Bestandteil des Audio-Streamings integriert. Für Unternehmen soll zu einem späteren Zeitpunkt zudem ein dedizierter Enterprise-API-Zugang bereitgestellt werden.
Regionale Beschränkungen beim Klonen
Trotz der breiten Verfügbarkeit der Modelle gelten für die Stimmreplikation in AI Studio rechtliche und regulatorische Einschränkungen. Die Funktion zur Voice-Replikation ist in bestimmten Rechtsräumen nicht freigeschaltet. Nutzer in den US-Bundesstaaten Illinois und Texas sowie im Europäischen Wirtschaftsraum, im Vereinigten Königreich, in der Schweiz und in Indien haben vorerst keinen Zugriff auf das Feature.
Wer die neuen Möglichkeiten generativer KI-Systeme rechtssicher nutzen möchte, muss die aktuellen EU-Vorgaben genau kennen. Dieser kompakte Leitfaden verschafft Ihnen den nötigen Überblick über Fristen, Pflichten und Risikoklassen. Kostenloses E-Book zum EU AI Act sichern
In diesen Regionen müssen Unternehmen und Entwickler die spezifischen Datenschutzvorgaben und die kommende EU-KI-Verordnung besonders streng beachten, bevor sie entsprechende Technologien implementieren.
