Gemma, Google

Gemma 4: Google bringt flüssige KI auf Macs mit 16 GB RAM

Veröffentlicht am: 24.07.2026 um 15:42 Uhr | Redaktion boerse-global.de

DeepMinds Open-Source-Modellfamilie Gemma 4 ermöglicht KI-Betrieb auf Macs mit 16 GB RAM und erreicht hohe Geschwindigkeiten durch optimierte Software.

Gemma 4 von DeepMind: Neue KI-Modelle laufen auf Macs mit 16 GB RAM
Nahaufnahme eines MacBook Pro mit abstrakten neuronalen Netzwerk-Visualisierungen auf dem Bildschirm. Illustration mit AI erstellt übermittelt durch boerse-global.de

Google DeepMind hat mit Gemma 4 eine neue Open-Source-Modellfamilie veröffentlicht, die erstmals flüssig auf Macs mit nur 16 Gigabyte RAM läuft.

Die Entwicklung markiert einen Wendepunkt für lokale KI-Anwendungen auf Apple Silicon. Während große Sprachmodelle bislang meist leistungsstarke Server-Hardware benötigten, ermöglichen optimierte Runtimes und Kompressionstechniken nun den Betrieb auf handelsüblichen Macs.

Fünf Modellgrößen für unterschiedliche Einsatzzwecke

Die Gemma-4-Reihe umfasst fünf Varianten – von den extrem effizienten E2B- und E4B-Modellen für Edge-Geräte bis zum 31 Milliarden Parameter starken Flaggschiff. Besonders bemerkenswert: Die E2B-Version läuft sogar auf einem Raspberry Pi 5. Das 31B-Modell hingegen glänzt in Benchmarks vor allem bei Reasoning-Aufgaben und Code-Generierung.

Parallel zu den Modellveröffentlichungen sorgen neue Inferenz-Engines für Furore. BaseRT, eine proprietäre Laufzeitumgebung für macOS, erzielt laut Herstellerangaben bis zu 6,4-fach höhere Geschwindigkeiten als das verbreitete llama.cpp. Der Trick: BaseRT schreibt direkt auf die Metal-GPU-API von Apple. Auf M3- und M4-Pro-Hardware erreichte die Engine 223 Tokens pro Sekunde bei Qwen3-0.6B-Modellen. Bei Mixture-of-Experts-Architekturen steigerte sich die Prefill-Geschwindigkeit um das 1,81-Fache – allerdings bleibt die Kompatibilität auf Architekturen wie LLaMA, Gemma und Whisper beschränkt.

Framework-Optimierungen senken Hardware-Hürden

Anzeige

Während die technische Umsetzung lokaler KI-Modelle immer effizienter wird, müssen Unternehmen auch die rechtlichen Rahmenbedingungen im Blick behalten. Welche Pflichten die neue EU-KI-Verordnung für die Entwicklung und den Einsatz solcher Systeme vorschreibt, erfahren Sie in diesem kompakten Leitfaden. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt

Auch auf Framework-Ebene tut sich einiges. PyTorch 2.13, das Anfang des Quartals erschien, bringt FlexAttention für Apple Silicon mit. Entwickler versprechen eine bis zu 12-fache Beschleunigung gegenüber der standardmäßigen Scaled-Dot-Product-Attention. Zusätzlich senkt das Update den GPU-Speicherverbrauch bei bestimmten Operationen um das Vierfache.

Das speziell für Apples Unified-Memory-Architektur entwickelte MLX-Framework bleibt das zentrale Werkzeug für lokale KI. Technische Anleitungen vom 22. Juli zeigen: Macs mit 16 GB RAM hosten 7B- bis 9B-Modelle mit 35 bis 60 Tokens pro Sekunde – bei 4-Bit-Quantisierung. Für 70B-Modelle mit 8-Bit-Präzision sind dagegen 128 GB RAM nötig.

Ollama Version 0.32.3 vom 23. Juli behebt zudem Probleme mit hängengebliebenen Modell-Downloads und erweitert die Hardware-Unterstützung auf NVIDIA B200 und Windows ARM64.

Neue Konkurrenz für Apple Silicon

Während Apple-Hardware kontinuierlich optimiert wird, drängen neue Anbieter auf den Markt. Acrab präsentierte am 23. Juli den G?LIX 1 SoC samt Agent-Box-System. Mit 20 Arm-CPU-Kernen und 273 GB/s Bandbreite soll das System beim Gemma-26B-Modell eine 7,5-fach höhere Prefill-Rate erreichen als der Mac Mini M4 Pro.

Anzeige

Mit dem rasanten Einzug von KI-Systemen in den Geschäftsalltag entstehen auch neue Anforderungen an die IT-Sicherheit und Compliance. Dieser kostenlose Report klärt auf, welche KI-Systeme als Hochrisiko eingestuft werden und was Unternehmen jetzt konkret für ihre Rechtssicherheit tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act sichern

KI auf dem Smartphone: Kompression macht’s möglich

Im Mobilbereich ermöglichen spezialisierte Kompressionstechniken den Betrieb großer Modelle auf Smartphones. PrismML, ein Spin-off des Caltech, portierte Alibabas 27B-Parameter-Modell Qwen 3.6 auf das iPhone 17 Pro. Durch patentierte Kompression schrumpfte der Speicherbedarf von 54 auf 4 Gigabyte – bei gleichbleibender Leistung. PrismML-Vertreter prognostizieren, dass innerhalb von drei Jahren der Großteil der KI-Leistung auf lokale Geräte verlagert wird.

Tether’s QVAC Fabric wiederum präsentierte das BitNet LoRA Framework für plattformübergreifendes Feintuning von 1-Bit-Modellen. Tests zeigen: Ein 1B-Modell lässt sich auf dem iPhone 16 in etwa einer Stunde und 45 Minuten feintunen – die BitNet-Architektur benötigt dabei deutlich weniger VRAM als Standard-16-Bit-Modelle.

Die aktuellen Entwicklungen passen zu breiteren Marktprognosen. Analysten von ABI Research erwarten, dass Inferenz-Workloads bis 2035 eine Leistung von 46 Gigawatt verbrauchen werden. Andere Forschungsinstitute sagen voraus, dass bis 2028 über 90 Prozent aller PCs über dedizierte Neural Processing Units verfügen werden.

Disclaimer zu unseren Artikeln: Keine Anlageberatung, keine Kauf- oder Verkaufsempfehlung. Angaben zu Kursen, Unternehmen und Märkten ohne Gewähr; Änderungen jederzeit möglich. Börsengeschäfte können zu hohen Verlusten führen. Unsere Beiträge werden ganz oder teilweise automatisiert mit Unterstützung von AI erstellt und geprüft.

de | wissenschaft | 69862989 |