Gemini, Transcribe

Gemini 3.5 Transcribe: Googles neues Sprach-zu-Text-Modell 70% schneller

Veröffentlicht am: 26.08.2026 um 20:02 Uhr | Redaktion boerse-global.de

Google präsentiert Gemini 3.5 Transcribe mit niedriger Fehlerquote und hoher Geschwindigkeit. Das Modell bereinigt Texte automatisch und unterstützt über 85 Sprachen.

Google Gemini 3.5 Transcribe: Neues KI-Modell für präzise Echtzeit-Transkription
Ein hochwertiges Studiomikrofon auf einem modernen Schreibtisch in einem hellen, verschwommenen Büro. Illustration mit AI erstellt übermittelt durch boerse-global.de

Google hat mit Gemini 3.5 Transcribe ein neues Sprach-zu-Text-Modell vorgestellt, das Transkriptionen in Echtzeit effizienter und intelligenter verarbeiten soll.

Die Neuentwicklung zielt darauf ab, gesprochene Sprache mit hoher Genauigkeit zu erfassen und gleichzeitig die Weiterverarbeitung durch künstliche Intelligenz zu optimieren. Das Modell bietet neben einer gesteigerten Verarbeitungsgeschwindigkeit auch Funktionen zur automatischen Bereinigung von Texten.

Hohe Genauigkeit und gesteigerte Effizienz

In Leistungsanalysen erreichte Gemini 3.5 Transcribe eine Wortfehlerrate (Word Error Rate, WER) von 4,0 % im Streaming-Modus. Bei der Verarbeitung von bereits aufgezeichneten, nicht-gestreamten Inhalten sank dieser Wert auf 2,6 %. Auch im FLEURS-Benchmark, einem Standardtest für Spracherkennung, erzielte das Modell Ergebnisse von 5,50 % WER im Streaming-Betrieb und 5,04 % WER im Non-Streaming-Modus.

Hinsichtlich der Recheneffizienz übertrifft die neue Version bisherige Lösungen des Unternehmens deutlich. Laut offiziellen Angaben arbeitet Gemini 3.5 Transcribe etwa 70 % schneller als das Vorgängermodell Chirp 3. Diese Leistungssteigerung ermöglicht eine nahezu verzögerungsfreie Umwandlung von Sprache in Text, was insbesondere für Live-Anwendungen und professionelle Workflows von Bedeutung ist.

Funktionsumfang und automatisierte Textkorrektur

Das Modell wurde für den globalen Einsatz konzipiert und unterstützt mehr als 85 Sprachen. Eine integrierte Sprechererkennung erlaubt es zudem, bis zu drei verschiedene Personen innerhalb einer Aufnahme zu identifizieren und voneinander abzugrenzen.

Anzeige

Wer sich mit dem Einsatz neuer KI-Systeme im Unternehmen befasst, muss neben der Effizienz auch die rechtlichen Rahmenbedingungen beachten. Dieser kostenlose Praxis-Leitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der aktuellen EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen

Ein technischer Schwerpunkt liegt auf der sprachlichen Qualität der Ergebnisse. Gemini 3.5 Transcribe ist in der Lage, Füllwörter wie „ums“ oder „ahs“ eigenständig aus den Transkriptionen zu entfernen. Darüber hinaus unterstützt das Modell „Function Calling“, wodurch Entwickler die Spracherkennung direkt mit spezifischen Softwarebefehlen verknüpfen können, um komplexe Aufgaben zu automatisieren.

Verfügbarkeit und Integration in das Ökosystem

Für Entwickler ist Gemini 3.5 Transcribe ab sofort als Public Preview verfügbar. Der Zugriff erfolgt über die Gemini API, Google AI Studio sowie die Plattformen Antigravity und die Enterprise Agent Platform.

Anzeige

Die Integration von KI-Lösungen in professionelle Workflows wirft oft Fragen zur Einstufung von Risikoklassen auf. Dieser kostenlose Report klärt auf, welche rechtlichen Pflichten Unternehmen jetzt kennen müssen und was bei der Dokumentation von KI-Systemen konkret zu tun ist. Kostenlosen Umsetzungsleitfaden zum EU AI Act sichern

Auch in Endnutzeranwendungen wird die Technologie bereits implementiert oder für die nahe Zukunft vorbereitet:
- Android: In ausgewählten Ländern treibt das Modell die Funktion Gboard Rambler an.
- macOS: Das Modell wird in der Gemini-App für macOS integriert, beginnend mit einer englischsprachigen Version.
- Chrome: Eine Integration in den Webbrowser ist geplant.

Zusätzlich hat das Unternehmen eine intelligente Diktierfunktion für macOS eingeführt, die systemweit in allen Anwendungen genutzt werden kann. Diese Funktion nutzt den Kontext des Bildschirminhalts, korrigiert Sätze und entfernt ebenfalls automatisch Füllwörter.

Die technische Voraussetzung für diese kostenlose, zunächst auf Englisch verfügbare Funktion ist macOS Sequoia 15.0+ sowie eine Hardwareausstattung von mindestens 8 GB Arbeitsspeicher und 200 MB freiem Speicherplatz.

Während Google mit der Einführung von Gemini 3.5 Transcribe den Bereich der Sprachtechnologie erweitert, steht die Veröffentlichung des Modells Gemini 3.5 Pro laut Branchenbeobachtern weiterhin aus.

Disclaimer...

de | wissenschaft | 70005488 |