Qwen3.8-Omni-Flash: Alibaba stellt KI-Modell mit einer Million Token vor
Veröffentlicht am: 19.09.2026 um 04:02 Uhr | Redaktion boerse-global.de
Der Technologiekonzern Alibaba hat mit Qwen3.8-Omni-Flash ein neues, nativ omni-modales KI-Modell vorgestellt, das für die Verarbeitung von Text, Bildern, Audio und Video in einem integrierten Workflow konzipiert ist. Wie aus Berichten vom 18. September 2026 hervorgeht, zielt das Modell primär auf den Einsatz von KI-Agenten in professionellen Produktivszenarien ab und verfügt über ein Kontextfenster von einer Million Token.
Multimodale Funktionsvielfalt und Agenten-Fokus
Das neue Modell unterstützt eine breite Palette an Aufgaben, darunter die automatisierte Aufgabenplanung, Tool-Aufrufe sowie die Erstellung von Inhalten. Zu den spezifischen Einsatzfeldern gehören laut Unternehmensangaben die Videobearbeitung, die Produktion von Musikvideos und Filmen sowie die Zusammenfassung von Audio- und Videoinhalten in Textform. Auch multimodale Konversationen in Echtzeit sind möglich.
Technisch erlaubt das Modell einen maximalen Input von etwa 992.000 Token, wobei dieser Wert je nach Nutzung der Reasoning-Funktion zwischen 983.616 und 991.808 Token variiert. Der maximale Output liegt bei 131.072 Token, während die Reasoning-Länge bis zu 262.000 Token erreichen kann.
Bei den Medienformaten verarbeitet das System Videos mit einer Länge von bis zu zwei Stunden oder einer Dateigröße von zwei Gigabyte sowie Audioaufnahmen von bis zu drei Stunden. Die Audiounterstützung umfasst dabei die Spracherkennung in bis zu 113 Sprachen und Dialekten sowie die Sprachgenerierung in 29 Sprachen.
Leistungsvergleich und Benchmark-Ergebnisse
In internen Evaluierungen übertraf Qwen3.8-Omni-Flash seinen Vorgänger Qwen3.5-Omni-Plus deutlich. Alibaba gibt an, dass das Modell in über 29 Benchmarks im Durchschnitt mehr als 25 % besser abschnitt. In einer weiteren Auswertung von über 30 Evaluierungen wurde eine durchschnittliche Verbesserung von mehr als 26 % verzeichnet.
Konkrete Leistungswerte wurden unter anderem für den WildClawBench-MM mit 71,0 Punkten (ein Zuwachs von 36,5 Punkten) und den AliMeeting-Benchmark mit 89,7 Punkten ausgewiesen.
Beim OmniVideoBench erreichte das Modell eine Genauigkeit von 63,4 bis 67,8, während der Token-Verbrauch in diesem Bereich um 45,7 % auf 79.117 gesenkt werden konnte.
Im direkten Vergleich mit Mitbewerbern wie Gemini 3.8 Flash erzielte das Modell laut den vorliegenden Daten im WildClawBench-MM 71,0 Punkte gegenüber 58,9 Punkten des Konkurrenzmodells.
Wer sich mit der Integration solch leistungsfähiger KI-Systeme befasst, muss auch die rechtlichen Rahmenbedingungen im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt
Im MMAU-Test lag der Wert bei 81,8 im Vergleich zu 76,9. Im AgenticVBench wurde Qwen3.8-Omni-Flash mit 36,8 Punkten bewertet, während Gemini 3.8 Flash hier 45,0 Punkte erreichte. Sämtliche Leistungswerte beruhen auf Angaben von Alibaba; eine unabhängige Prüfung der Ergebnisse steht bislang aus.
Effizienzsteigerung und Preisstruktur der API
Ein wesentlicher Fokus der Neuentwicklung liegt auf der Reduzierung von Latenz und Betriebskosten. Im Vergleich zum Vorgängermodell konnten die Kosten für die Spracheingabe pro Stunde um über 98 % gesenkt werden. Die Kosten für kombinierte Audio- und Videoinhalte fielen um über 93 %, reine Videoanwendungen wurden um rund 89 % günstiger.
Die API-Preise für Qwen3.8-Omni-Flash liegen bei 0,15 US-Dollar pro eine Million Input-Token und 0,47 US-Dollar pro eine Million Output-Token. Für Cache-Token werden 0,016 US-Dollar pro eine Million Einheiten fällig. Das Modell basiert auf Qwen3.8-Flash-Next und wird ausschließlich gehostet angeboten; offene Gewichte stehen nicht zur Verfügung.
Der Einsatz innovativer KI-Lösungen stellt Unternehmen nicht nur vor technische, sondern auch vor neue regulatorische Herausforderungen. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und was Verantwortliche jetzt konkret tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act jetzt herunterladen
Zusätzlich zur Veröffentlichung des Hauptmodells wurden Qwen-MM-Plugins und das Qwen-Live Harness für Langzeit-Workflows vorgestellt. Bereits am 17. September 2026 nahm Alibaba Cloud zudem zwei neue Endpunkte in seinen Katalog auf, darunter Qwen3.8-LiveTranslate-Flash-Realtime.
Dieser WebSocket-basierte Dienst unterstützt 60 Input- und 29 Output-Sprachen für Echtzeitübersetzungen. Die Verfügbarkeit ist zum Start auf sechs Regionen begrenzt, zu denen neben Peking, Singapur und Tokio auch Frankfurt gehört.
