Laut Tencents Modellkarte ist Hy3 ein Mixture-of-Experts-Modell mit 295 Mrd. Gesamt- und 21 Mrd. aktiven Parametern; die Sparse-Architektur nutzt 192 Experten mit Top-8-Aktivierung, dazu kommen 3,8 Mrd. Parameter in einer MTP-Schicht (Multi-Token-Prediction). Die Kontextlänge liegt bei 256K Token, die Lizenz ist Apache 2.0. Auf Hugging Face liegt das volle Modell mit rund 598 GB, eine FP8-Quantisierung mit rund 300 GB; kostenlos ausprobieren lässt es sich bis zum 21. Juli 2026 über OpenRouter.
Tencent gibt als Benchmark-Werte u. a. SWE-bench Verified 78, SWE-bench Pro 57,9 und GPQA Diamond 90,4 an und berichtet in einer Blind-Expert-Bewertung 2,67/4 für Hy3 gegenüber 2,51/4 für GLM-5.1. Ferner nennt die Modellkarte interne Reduktionen der Halluzinationsrate (von 12,5 % auf 5,4 %) und der Commonsense-Fehler (von 25,4 % auf 12,7 %). Die Preview war im April 2026 erschienen; für die jetzige Version habe man Feedback aus über 50 Produkten eingearbeitet und das Post-Training mit höherwertigen Daten skaliert.
Einordnung: Sämtliche genannten Zahlen sind anbieter-selbstberichtet (Tencent, Tier A als Primärquelle für Existenz/Spezifikation, aber nicht neutral für Leistungsvergleiche) und wurden unabhängig noch nicht reproduziert; Vergleichsaussagen gegen „zwei- bis fünfmal größere Modelle“ sind entsprechend vorsichtig zu lesen. Belastbar ist der Release selbst: ein weiteres frei lizenziertes, sparsam aktiviertes Frontier-Kandidatenmodell aus China. Simon Willison hat den Release am selben Tag aufgegriffen.
Nachtrag 17.07.2026 – die unabhängige Messung liegt vor, und sie fällt nüchterner aus. Artificial Analysis hat Hy3 inzwischen vermessen: Intelligence-Index 41, Coding-Index 59, Terminal-Bench v2.1 64 %, GPQA Diamond 90 %, HLE 32 %. Damit ist der oben notierte Vorbehalt eingelöst – und die Vergleichsaussage „auf Augenhöhe mit zwei- bis fünfmal größeren Modellen“ trägt nicht: Das offene Spitzenmodell GLM-5.2 liegt mit 51 / 69 / 78 % klar davor, DeepSeek V4 Pro mit 44 / 59 / 64 % gleichauf bis leicht davor. Besonders auffällig ist die Diskrepanz beim Agentik-Benchmark: In einem von Tencent gesponserten YouTube-Video kursieren 71,7 % auf Terminal-Bench 2.1 – gemessen sind es 64 %. Der belastbare Befund ist ein anderer und für Nutzer der interessantere: Hy3 ist nicht das stärkste, aber mit Abstand das günstigste offene Modell seiner Leistungsklasse. Ab dem 21. Juli kostet es $0,14 / $0,58 je Mio. Token – bei praktisch identischem Coding-Index rund ein Drittel des DeepSeek-V4-Pro-Preises ($0,44 / $0,87) und ein Zehntel von GLM-5.2 ($1,40 / $4,40). Gegenrechnung: Laut AA ist das Modell „notably slow and very verbose“ (~48 Token/s), was den Preisvorteil je Aufgabe teilweise aufzehrt. Hy3 ist mit dieser Messung in den Modell-Katalog aufgenommen worden.
Aktualisiert am 17. Juli 2026.