Alle Depeschen

DepescheModelleneu

IBM öffnet Granite 4.2 – erstmals dichte Reasoning-Modelle der Reihe, in 3, 8 und 30 Milliarden Parametern unter Apache 2.0

IBM hat am 25. August 2026 die Granite-4.2-Familie veröffentlicht: drei dichte, rein dekodierende Reasoning-Modelle mit 3, 8 und 30 Milliarden Parametern, alle unter Apache 2.0. Es sind nach IBMs eigener Beschreibung „our first family of dense, decoder-only reasoning LLMs“; vortrainiert wurde von Grund auf auf rund 15 Billionen Token, jedes Modell trägt einen Schalter zwischen Denk-, Nicht-Denk- und Sparmodus. Die genannten Werte – etwa 57 % auf SWE-Bench Verified und 89,17 % auf AIME25 für die 30-B-Variante – stammen von IBM selbst.

Der Bruch zur bisherigen Granite-4-Reihe liegt in der Architektur: Granite 4.2 ist nach IBMs eigenen Worten „our first family of dense, decoder-only reasoning LLMs“ – die Vorgänger setzten auf hybride Bauformen. Ausgeliefert wird in drei Größen, „released in three sizes: 3B, 8B, and 30B“, die Modellkarten liegen als ibm-granite/granite-4.2-3b, -8b und -30b auf Hugging Face. Lizenz: „All Granite 4.2 models are released under the Apache 2.0 license.“

Zum Verfahren macht IBM ungewöhnlich konkrete Angaben: vortrainiert „from scratch on roughly 15T tokens with a five-phase strategy“, danach überwacht feinabgestimmt auf „chain-of-thought, reasoning, and agentic-trajectory data“ mit einem SFT-Korpus von „approximately 7.2 million samples, or roughly 100B tokens“, anschließend „post-trained with a multi-stage reinforcement learning pipeline“. Jedes Modell hat einen Denk-Schalter samt Sparstufe: „Seamlessly switch between full thinking, non-thinking, and low-effort modes“, gesteuert über die Parameter „enable_thinking“ und „low_effort“.

Kontextlänge: Die Modellkarte nennt „Natively Supports 128K (Long-context extension to 512K)“ – die 512K sind also eine Erweiterung, nicht die native Länge. Der Blogtext spricht verkürzt von „extending the context window to 512K tokens“; wer die Modelle einsetzt, sollte von 128K nativ ausgehen.

Die Benchmark-Tabelle im Blog listet unter anderem SWE-Bench Verified (8B: 47,67 %, 30B: 57,00 %), AIME25 (3B: 78,33 %, 8B: 86,67 %, 30B: 89,17 %), MMLU-Pro (30B: 77,60 %) und RULER 128K (30B: 81,38 %). Autor ist das „Granite Team, IBM“; ein Vergleich zu Qwen, Llama oder gpt-oss steht in der Ankündigung nicht, und dass die Zahlen extern nachgemessen wären, behauptet IBM auch nicht. Sie sind damit anbieter-selbstberichtet zu lesen.