2 / 3514

35B-Modell läuft auf dem iPhone mit 11 Tokens pro Sekunde

TL;DR

Better Stack zeigt, wie ein Mixture-of-Experts-Modell mit 35 Milliarden Parametern direkt auf einem iPhone 17 läuft, mit rund 11 Tokens pro Sekunde. Pro Schritt sind nur 3 Milliarden Parameter aktiv, die für iOS angepasste Flash-MoE-Engine erledigt den Rest. Gestaffelte Quantisierung (4 Bit für häufig genutzte, 2 Bit für seltene Experts) drückt das Modell von 19 auf 13 GB. Im RAM liegen nur etwa 1,4 GB, der Rest wird bei Bedarf von der SSD nachgeladen.

Nauti's Take

Ein 35B-Modell lokal auf dem iPhone ist ein spannender Fortschritt für Datenschutz und Offline-Nutzung. Der Haken bleibt die Praxis: Hitze, 13 GB Speicher und ein Setup über Xcode sind nichts für den Alltag.

Für Entwickler ist das ein wertvoller Blick darauf, wohin On-Device-AI geht. Alle anderen warten besser, bis Apple oder App-Anbieter das sauber verpacken.

Video

Quellen