Werkzeug · Lokaler Runner
FreeToken
von FlashML (Open Source, UC Berkeley / MIT)
Inferenz-Motor, der große Mixture-of-Experts-Modelle auf Consumer-Hardware bedient, indem er Experten laufend zwischen GPU, CPU und Arbeitsspeicher umschichtet statt sie fest zu verteilen.
Einschätzung
Für MoE-Modelle, die zu groß für die Karte sind
Wofür es gut ist
- Große MoE-Modelle betreiben, die nicht in den Grafikspeicher passen
- Agentische Werkzeugketten lokal, ohne Token-Gebühren
- Frontier-nahe offene Gewichte auf einer einzelnen Workstation
Stärken
- Adaptiv statt konfiguriert: misst PCIe- und Speicherbandbreite der eigenen Maschine und teilt fehlende Experten danach zwischen GPU und CPU auf
- Verschiebt die praktische Grenze deutlich – laut Preprint 35 Mrd. auf einem Laptop, 284 Mrd. auf einem Gaming-Desktop, 753 Mrd. (GLM-5.2) auf einer einzelnen Workstation-GPU
- Apache-2.0, über 20 MoE-Modelle unterstützt; Preprint mit nachprüfbarer Autorenliste (u. a. Kurt Keutzer, Song Han, Matei Zaharia, Ion Stoica)
- Der Experten-Cache lässt sich am laufenden Server ohne Neustart in der Größe ändern
Schwächen
- Nur für Mixture-of-Experts-Modelle und nur oberhalb der VRAM-Schwelle sinnvoll – passt das Modell auf die Karte, ist Ollama schneller
- Kein Apple Silicon: die Projektangaben nennen NVIDIA RTX 30/40/50 unter Linux und Windows
- Die Desktop-Anwendung ist nach unabhängigem Test noch rudimentär (kein Projektordner-Zugriff, keine Dateiänderungen)
- Die Leistungszahlen des Preprints sind von den Erbauern selbst gemessen und nicht begutachtet
Im Vergleich
Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.
Gegenüber Ollama und llama.cpp ist FreeToken kein bequemerer Einstieg, sondern eine Spezialisierung: Es gewinnt genau dort, wo die anderen Schichten fest zwischen GPU und CPU aufteilen und jedes Token deshalb den langsamen Weg mitgeht. Unterhalb der VRAM-Schwelle dreht sich das Verhältnis um.
Stimmen aus der Community
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- gemischtUnabhängige Praxismessung auf einer RTX 5090 (32 GB) mit 64 GB DDR5: Qwen 3.6 mit 35 Mrd. Parametern in 8-Bit (rund 38 GB, also 6 GB über der Karte) brauchte mit Ollama 14 Minuten 20 Sekunden bei rund 58 Token/s, mit FreeToken 4 Minuten 40 Sekunden bei 132 Token/s. Beim 4-Bit-Stand desselben Modells, der vollständig auf die Karte passt, kehrt sich das Bild um: Ollama 240, FreeToken 225 Token/s – „if your model comfortably fits on your GPU, Ollama is most definitely the faster choice“. Beim Verkleinern des Experten-Caches kostete der Schritt von 58 auf 40 Prozent nur rund 7 Prozent Geschwindigkeit; unter 20 Prozent bricht die Leistung ein.Better Stack (YouTube) – „How They Fixed AI’s Biggest Local Hardware Problem (with FreeToken)“, 29.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen; Fundstelle dieses Eintrags. ⚠️ Die dort genannte Herkunft „Berkeley and University of Texas“ ist falsch – der Preprint und die Rezeption nennen UC Berkeley und MIT) · Community, August 2026
Direkt ausprobieren
github.com/FlashML-org/FreeToken