Werkzeug · Lokaler Runner
TurboFieldfare
von drumih (Open Source)
Führt Googles Gemma 4 26B-A4B auf jedem Apple-Silicon-Mac in rund zwei Gigabyte Arbeitsspeicher aus – indem die Experten des Modells auf der SSD bleiben.
Einschätzung
MoE-Experten von der SSD statt aus dem RAM
Wofür es gut ist
- Ein 26-Milliarden-Modell auf einem Mac mit wenig Arbeitsspeicher betreiben
- Lokale Inferenz ohne Cloud, mit OpenAI-kompatibler Schnittstelle
- Nachvollziehen, wie SSD-Streaming von MoE-Experten praktisch funktioniert
Stärken
- Rund zwei Gigabyte Arbeitsspeicher für ein Modell mit 25,2 Mrd. Parametern (3,8 Mrd. aktiv je Token)
- Apache 2.0; Swift-Bibliothek, CLI, Mac-App und OpenAI-kompatibler lokaler Server
- Nutzt Apple-Silicon-Eigenheiten gezielt aus (Unified Memory, Metal-4-Kernel, SSD-Streaming)
Schwächen
- Nur macOS 26 mit Metal 4, nur ein einziges Modell (Gemma 4 26B-A4B) – kein allgemeiner Runner
- Junges Ein-Personen-Projekt (erste Fassung 20.07.2026, aktuell v0.3); Leistungszahlen unabhängig nicht reproduziert
- Tempo hängt an SSD und Trefferquote des Experten-Caches; auf schwacher Hardware unter 7 Token/s
Im Vergleich
Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.
Gegenüber Ollama und LM Studio ist der Zuschnitt umgekehrt: Die beiden führen viele Modelle aus, laden dafür aber alles in den Arbeitsspeicher – für ein 26-Milliarden-Modell heißt das rund 14 Gigabyte. TurboFieldfare kann genau ein Modell und kommt dafür mit rund zwei aus. Wer die Wahl zwischen Modellen braucht, nimmt die etablierten Runner; wer ein großes Modell auf einem kleinen Mac braucht, hat hier die einzige belegte Option.
Stimmen aus der Community
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- positivDer Kanal Better Stack hat das Projekt selbst durchlaufen lassen und misst 23,4 Token pro Sekunde bei 2,15 Gigabyte Speicherbedarf auf einem M3 Max: „This feels completely usable to me.“ Der Wert liegt zwischen den beiden Projekt-Messungen (M2 Air, M5 Pro) und ist damit plausibel – aber eine einzelne, nicht reproduzierte Fremdmessung.Better Stack – „Local AI On Apple Silicon uses 7X Less RAM“ (YouTube) · Community, August 2026
Direkt ausprobieren
github.com/drumih/turbo-fieldfare
ℹ️