← Alle Werkzeuge

Werkzeug · Lokaler Runner

TurboFieldfare

von drumih (Open Source)

Führt Googles Gemma 4 26B-A4B auf jedem Apple-Silicon-Mac in rund zwei Gigabyte Arbeitsspeicher aus – indem die Experten des Modells auf der SSD bleiben.

Open SourcemacOSOpen SourceCLI

Einschätzung

MoE-Experten von der SSD statt aus dem RAM

Bemerkenswert, weil es die Untergrenze verschiebt: Ein MacBook Air mit acht Gigabyte reicht laut Projekt für Gemma 4 26B-A4B. Der Preis dafür sind Lesezugriffe – 30-mal je Token muss die SSD angefasst werden, und die Geschwindigkeit hängt daran, wie gut der Experten-Zwischenspeicher trifft. Einordnung: Ein-Personen-Projekt in Version 0.3, sämtliche Leistungszahlen sind Selbstmessung. Für den Alltag bleiben Ollama und LM Studio die robustere Wahl; TurboFieldfare ist der interessantere Beweis, dass es auch mit einem Bruchteil des Speichers geht.

TurboFieldfare ist eine in Swift 6.2 und Metal 4 geschriebene Inferenz-Laufzeit für genau ein Modell: Googles open-weightModell, dessen trainierte Gewichte öffentlich herunterladbar sind, sodass man es selbst (lokal oder auf eigener Hardware) betreiben kann. Nicht zwingend vollständig quelloffen – die Lizenz bestimmt die erlaubte Nutzung.Mehr im Wissen → MoE (Mixture of Experts)Architektur, bei der je Anfrage nur ein Teil des Modells („Experten“) aktiv wird. So hat das Modell sehr viele Gesamt-Parameter, rechnet aber nur mit wenigen aktiven – das spart Rechenzeit.Mehr im Wissen →-Modell Gemma 4 26B-A4B. Der Zweck ist nicht Geschwindigkeit, sondern Speicherbedarf – das installierte Modell wiegt rund 14,3 Gigabyte, laufen soll es in etwa zwei.

Der Weg dorthin nutzt die Bauweise von Mixture-of-Experts aus: Je Token arbeiten nur acht von 128 Experten pro Schicht. Was in einem Moment nicht rechnet, muss auch nicht im Arbeitsspeicher liegen. Resident bleiben deshalb nur die rund 1,35 Gigabyte, die jedes Token braucht – Attention, Router, Embeddings und der eine gemeinsame Experte – plus der KV-Cache; die gerouteten Experten liegen auf der SSD und werden pro Token nachgeholt. Je Schicht hält ein Zwischenspeicher 16 Experten vor und verdrängt nach dem am seltensten benutzten Eintrag (LFU).

Dass das ein reines Mac-Projekt ist, hat einen technischen Grund: Auf Apple Silicon teilen sich Prozessor und Grafikeinheit denselben physischen Speicher, ein frisch von der Platte gelesener Gewichtsblock ist damit ohne Umkopieren für die GPU sichtbar. Auf einem PC mit dedizierter Grafikkarte müsste jeder Block zusätzlich über PCIe in den VRAM. Mitgeliefert werden eine Swift-Bibliothek, ein Kommandozeilenwerkzeug, ein OpenAI-kompatibler lokaler Server und eine native Mac-App.

Wofür es gut ist

  • Ein 26-Milliarden-Modell auf einem Mac mit wenig Arbeitsspeicher betreiben
  • Lokale Inferenz ohne Cloud, mit OpenAI-kompatibler Schnittstelle
  • Nachvollziehen, wie SSD-Streaming von MoE-Experten praktisch funktioniert

Stärken

  • Rund zwei Gigabyte Arbeitsspeicher für ein Modell mit 25,2 Mrd. Parametern (3,8 Mrd. aktiv je Token)
  • Apache 2.0; Swift-Bibliothek, CLI, Mac-App und OpenAI-kompatibler lokaler Server
  • Nutzt Apple-Silicon-Eigenheiten gezielt aus (Unified Memory, Metal-4-Kernel, SSD-Streaming)

Schwächen

  • Nur macOS 26 mit Metal 4, nur ein einziges Modell (Gemma 4 26B-A4B) – kein allgemeiner Runner
  • Junges Ein-Personen-Projekt (erste Fassung 20.07.2026, aktuell v0.3); Leistungszahlen unabhängig nicht reproduziert
  • Tempo hängt an SSD und Trefferquote des Experten-Caches; auf schwacher Hardware unter 7 Token/s

Im Vergleich

Wofür dieses Werkzeug die bessere Wahl ist – und wann ein direkter Konkurrent.

  • Gegenüber Ollama und LM Studio ist der Zuschnitt umgekehrt: Die beiden führen viele Modelle aus, laden dafür aber alles in den Arbeitsspeicher – für ein 26-Milliarden-Modell heißt das rund 14 Gigabyte. TurboFieldfare kann genau ein Modell und kommt dafür mit rund zwei aus. Wer die Wahl zwischen Modellen braucht, nimmt die etablierten Runner; wer ein großes Modell auf einem kleinen Mac braucht, hat hier die einzige belegte Option.

Stimmen aus der Community

Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.

Direkt ausprobieren

github.com/drumih/turbo-fieldfare

Zur offiziellen Seite ↗

ℹ️ Über den YouTube-Sweep vom 02.08.2026 aufgekommen (C58 Better Stack, Tier C). Sämtliche Kennzahlen am Repo-README, an den Releases und an Googles Modellkarte gegengeprüft, nicht am Video. Abweichung dokumentiert: Das Projekt schreibt „26B total, about 3.88B active“, die Modellkarte nennt 25,2 Mrd. gesamt und 3,8 Mrd. aktiv – wir folgen der Modellkarte. Ausführlich in der Depesche `turbo-fieldfare-gemma-4-26b-zwei-gigabyte-apple-silicon`.

Verwandte Werkzeuge