Zwei RTX 4090: Strata steigert Code-Generierung um bis zu 132 Prozent
Veröffentlicht am: 05.10.2026 um 02:34 Uhr | Redaktion boerse-global.deDie lokale Inferenz-Engine Strata des Entwicklers Niko1221 hat mit dem Update auf Version 0.1.39 signifikante Leistungssteigerungen bei der Ausführung großer Sprachmodelle auf Endkunden-Grafikkarten erzielt.
Wie aus einem Fachbericht vom 4. Oktober 2026 hervorgeht, konzentriert sich die Aktualisierung insbesondere auf die Beschleunigung des sogenannten Decodes für Modelle der 125B-Klasse, während die Ausgabequalität bit-identisch zum Vorgänger v0.1.38 bleibe.
Leistungssteigerungen bei Consumer-Grafikkarten
Die technischen Messwerte verdeutlichen den Performance-Zuwachs für unterschiedliche Hardware-Konfigurationen. Bei der Nutzung einer einzelnen NVIDIA RTX 5070 stiegen die Verarbeitungsgeschwindigkeiten bei Verwendung der Quantisierung Q2_0 um etwa 6 Prozent.
Konkret kletterten die Werte bei der Textgenerierung von 68,4 auf 72,7 Token pro Sekunde (tok/s), während bei Programmieraufgaben eine Steigerung von 75,8 auf 80,0 tok/s gemessen wurde.
Noch deutlicher fallen die Zuwächse in Multi-GPU-Umgebungen aus. Ein System mit zwei RTX-4090-Karten erreichte durch eine optionale Optimierung eine Steigerung von 63 Prozent bei Textaufgaben und 132 Prozent bei Code-Generierung.
Für Nutzer kleinerer Grafikkarten mit 12 GB VRAM wurde zudem die Startzeit bei parallelen Anfragen optimiert: Der vierte gleichzeitige Request starte nun in 1,8 Sekunden statt der bisherigen 11,2 Sekunden, wenngleich die Verarbeitungsgeschwindigkeit im Batch-Betrieb um 11 Prozent gesunken sei.
Technische Architektur und Speicher-Management
Strata ermöglicht den Betrieb des Modells Qwen3.8-Flash-Next, eines Mixture-of-Experts-Systems (MoE) mit 125 Milliarden Parametern, auf Systemen ab 8 GB bis 12 GB Grafikspeicher (VRAM). Die Engine nutzt hierfür ein dreistufiges Speicherkonzept aus VRAM, System-RAM und SSD-Speicher.
Während Strata die Grenzen lokaler KI-Hardware ausreizt, stellt die neue EU-Regulierung Unternehmen vor ganz andere technische Herausforderungen. Dieser kostenlose Download verschafft Ihnen den Überblick über Fristen, Pflichten und Risikoklassen, den Ihre Rechts- und IT-Abteilung jetzt dringend braucht. EU AI Act in 5 Schritten verstehen
Während die aktiven Experten-Layer und der KV-Cache im VRAM gehalten werden, lagert das System alle 24.576 Experten im Arbeitsspeicher (RAM) aus. Zusätzlich wird eine 28,8 GB große n-gram-Lookup-Tabelle auf der SSD hinterlegt.
Diese Tabelle umfasst über 320 Millionen Zeilen und wird per Zufallszugriff über DirectFile ausgelesen, wobei ein 95 MB großer Cache laut Berichten vom 3. Oktober 2026 bis zu 82 Prozent der Leseanfragen bei wiederkehrenden Sequenzen bedienen kann.
Zusätzliche Geschwindigkeit gewinnt die Engine durch spekulatives Dekodieren. Hierbei wird ein modell-eigener Draft-Layer genutzt, der rund 0,9 GB VRAM belegt. Dieses Verfahren soll die Netto-Geschwindigkeit um den Faktor 1,6 bis 1,8 erhöhen, ohne die Qualität der Antworten zu beeinträchtigen. Ein integrierter Controller entscheidet dabei dynamisch, ob Suffix-Lookups oder andere Verfahren den größten Zeitgewinn versprechen.
Anforderungen und Sicherheitsaspekte
Trotz der Optimierungen für Mittelklasse-Hardware bleiben die Anforderungen an den Arbeitsspeicher hoch. Während eine spezialisierte Coder-Variante des Modells mit 32 GB RAM auskommt, werden für die volle Funktionalität und höhere Quantisierungen 64 GB RAM oder mehr empfohlen. Der Modelldownload umfasst etwa 70 GB, wobei im Betrieb zwischen 35 und 55 GB in den RAM geladen werden.
Bereits in der Version 0.1.38, die laut Berichten vom 3. Oktober 2026 veröffentlicht wurde, adressierten die Entwickler zudem Sicherheitsaspekte. Ein Patch blockiert seitdem DNS-Rebinding-Angriffe gegen den lokalen Server, indem Anfragen von nicht vertrauten Hosts mit einem Fehlercode 403 abgewiesen werden.
Wer sich mit dem Einsatz lokaler KI-Systeme befasst, muss auch die rechtlichen Rahmenbedingungen für Hochrisiko-Anwendungen im Blick behalten. Ein kostenloser Report klärt auf, welche neuen Regeln die EU-KI-Verordnung aufstellt und was Unternehmen jetzt konkret tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act anfordern
Das Open-Source-Projekt, das unter der MIT-Lizenz steht, verzeichnete zuletzt rund 10.000 Sterne auf der Plattform GitHub. Trotz des Erfolgs gibt es auch kritische Stimmen: In Branchenblogs wurde die Frage aufgeworfen, wie hoch der Anteil von KI-generiertem Code in der Engine selbst sei und inwieweit dies die Verifizierbarkeit beeinflusse. Zudem stufte das Qwen-Entwicklerteam das genutzte Modell Qwen3.8-Flash-Next Ende August als eine noch untertrainierte Vorschau-Version ein.
