14 / 3593

Apple M3 Neural Engine erreicht 24,3 Tokens pro Sekunde mit Llama 3.2 1B

TL;DR

Apples Neural Engine im M3-Chip soll bei lokalen AI-Aufgaben bestimmte Rechenschritte von CPU und GPU übernehmen. Laut Geeky Gadgets wurden mit dem kleinen Modell Llama 3.2 1B bis zu 24,3 Tokens pro Sekunde erreicht, was in passenden Szenarien ungefähr einer Verdopplung der Verarbeitungsgeschwindigkeit entsprechen könnte. Die Angabe stammt aus einem einzelnen Bericht und beschreibt offenbar einen spezifischen Testaufbau.

Nauti's Take

Für ein kleines Team ist die Zahl erst nachstellbar, wenn Modellversion, Quantisierung, Laufzeit und Tokenzählung offengelegt sind. Der sinnvolle Praxistest läuft mit dem eigenen lokalen Workflow: dieselbe Llama-Version auf CPU, GPU und Neural Engine messen und dabei Geschwindigkeit, Stromverbrauch sowie Antwortqualität vergleichen.

Video

Quellen