DeepSeek V4 Flash: Mac M5 Max führt KI lokal mit 790 Token/ Sekunde
Veröffentlicht am: 02.09.2026 um 11:42 Uhr | Redaktion boerse-global.de
Die lokale Ausführung leistungsfähiger Künstlicher Intelligenz auf Workstations erreicht ein neues Leistungsniveau. Anfang September demonstrierte der Entwickler Salvatore Sanfilippo, in Fachkreisen unter dem Pseudonym antirez bekannt, den Betrieb des Modells DeepSeek V4 Flash auf einem Apple Mac M5 Max.
Die Demonstration verdeutlichte, dass moderne Desktop-Hardware in Kombination mit optimierter Software zunehmend in der Lage ist, Aufgaben zu bewältigen, die bisher Cloud-Infrastrukturen vorbehalten waren.
Hohe Verarbeitungsgeschwindigkeiten bei unterschiedlichen Kontexten
Im Rahmen der Demonstration am ersten September wurden detaillierte Leistungsdaten zur Verarbeitung von Tokens veröffentlicht. Sanfilippo nutzte für den Test einen Mac M5 Max, der mit einem Arbeitsspeicher von 128 GB ausgestattet war. Um den Betrieb des Modells auf dieser Hardware zu ermöglichen, kam eine 2-Bit-Quantisierung zum Einsatz.
Die Messwerte zeigten signifikante Unterschiede zwischen der sogenannten Prefill-Leistung – dem Einlesen des Kontextes – und der eigentlichen Token-Generierung. Bei einem kurzen Kontext von 2.048 Token erreichte das System eine Prefill-Leistung von 790,18 Token pro Sekunde. Wurde die Kontextlänge auf 65.536 Token erhöht, sank dieser Wert auf 398,50 Token pro Sekunde.
Wer das volle Potenzial seines Apple-Computers für anspruchsvolle Aufgaben ausschöpfen möchte, sollte sein System von Beginn an optimal konfigurieren. Dieser kostenlose Ratgeber enthüllt die wichtigsten Einstellungen, die kaum jemand beim Start kennt. Was Apple-Experten jedem Mac-Einsteiger empfehlen
In der Phase der aktiven Textgenerierung lieferte das System bei kurzem Kontext 39,35 Token pro Sekunde. Bei der Nutzung des langen Kontextes von 65.536 Token wurde eine Generierungsleistung von 27,64 Token pro Sekunde gemessen. Diese Werte belegen, dass flüssige Interaktionen mit dem Modell auch bei komplexeren Aufgabenstellungen lokal möglich sind.
Software-Grundlage und Systemanforderungen
Für die Ausführung des Modells wurde die Software DwarfStar4 (DS4) verwendet. Das Werkzeug ist unter der MIT-Lizenz veröffentlicht und genießt in der Entwicklergemeinschaft bereits eine beachtliche Aufmerksamkeit, was sich in 21.984 Sternen auf der Plattform GitHub widerspiegelt.
Die Flexibilität der Software wird durch die Unterstützung verschiedener Backends unterstrichen; neben Metal für Apple-Hardware werden auch CUDA für Nvidia-Systeme sowie ROCm für AMD-Komponenten unterstützt.
Leistungsstarke Hardware wie der Mac bietet enorme Möglichkeiten, doch viele Nutzer verschenken wertvolle Performance durch Standard-Setups. Das gratis PDF-Starterpaket verrät die cleveren Tricks, mit denen Sie Ihren Mac von Tag 1 an professionell nutzen. So werden Sie in kürzester Zeit zum Mac-Profi – völlig kostenlos
Trotz der Optimierungen bleiben die Hardware-Anforderungen für den lokalen Betrieb anspruchsvoll. Das Modell DeepSeek V4 Flash benötigt in der getesteten Konfiguration etwa 81 GB Speicher. Experten empfehlen für einen stabilen Betrieb eine Ausstattung von 96 bis 128 GB RAM, um ausreichend Reserven für das Betriebssystem und die parallele Verarbeitung vorzuhalten.
Integration von Vision-Funktionen
Ein wesentliches Merkmal der gezeigten Demonstration ist die Integration von Vision-Fähigkeiten, die es dem Modell ermöglichen, Bilddaten zu verarbeiten. Das zugrundeliegende Vision-Exp-Modell von DeepSeek beinhaltet einen spezialisierten Encoder mit einer Größe von 0,9 GiB.
Wie bereits in technischen Dokumentationen aus dem August hervorging, ist die Bildverarbeitung auf eine effiziente Token-Nutzung optimiert. Pro verarbeitetem Bild werden 384 Token verbraucht. Dies ermöglicht es dem System, visuelle Informationen in den Textkontext zu integrieren, ohne die verfügbaren Ressourcen unverhältnismäßig stark zu belasten.
Die Ergebnisse der Demonstration zeigen, dass die Kombination aus hochperformanten Chipsätzen wie dem M5 Max und spezialisierten Quantisierungsmethoden die Schwelle für den professionellen Einsatz von lokalen KI-Modellen weiter senkt. Insbesondere für Anwendungen, bei denen Datenschutz oder Unabhängigkeit von Cloud-Anbietern im Vordergrund stehen, bietet dieser technologische Fortschritt eine tragfähige Grundlage.
