Was veröffentlicht wurde. Der Beitrag beschreibt die Freigabe als ersten Baustein: „Today, we are releasing the first layer of that effort: @huggingface/kernels, a minimal library for loading and running optimized WebGPU kernels from the Hugging Face Hub, together with an initial collection of 207 kernels“. Die Kernel selbst sind „published as individual repositories in the webgpu-kernels organization. Apache-2.0 licensed.“ Voraussetzung auf der Nutzerseite: „Running these kernels requires a browser with WebGPU support“, wobei die Unterstützung von Browser, Betriebssystem, GPU und Treiber abhängt.
Der Vergleich und seine Bedingungen. Als Messlatte diente die etablierte Browser-Laufzeit: „We put our collection head-to-head with ORT WebGPU on an Apple M4 GPU, using ONNX Runtime Web 1.30.0-dev.20260826-b1f76d586a.“ Das Ergebnis: „Across those comparisons, our kernels were 2.57x faster by geometric mean and 1.90x faster at the median, with 629 wins, 176 losses, and 4 ties.“ Die Grundmenge wurde dabei gefiltert: „We started with 1,756 test cases across all 207 operations and kept the 809 cases where both sides produced matching outputs and reliable timings.“ Und der Messrahmen ist eng gezogen: „We timed the work done on the GPU itself, leaving out setup such as loading kernels, creating sessions, uploading inputs, compiling shaders, and reading outputs back.“ Ausgewiesene Einzelwerte reichen von 1,14-fach (MatMul) über 2,11-fach (Softmax) und 2,22-fach (LayerNormalization) bis zu 3,52-fach (Add) – die Ausreißer „more than 10,000x faster“ (Bilinear Einsum) und „301x faster“ (Row-wise CumSum) sagen mehr über Lücken im Vergleichsmaßstab als über Alltagsgewinne.
Anbieterunabhängig belegt ist die Freigabe selbst: Die npm-Registry führt `@huggingface/kernels` mit den dist-tags `latest` und `preview` auf jeweils `0.0.1-preview.1`, Lizenz Apache-2.0, Homepage `huggingface.co/webgpu-kernels`, jüngste Veröffentlichung am 01.09.2026 um 14:25:43 UTC. Ein Repository-Feld ist im Registry-Eintrag nicht gesetzt. Die Versionsnummer ist damit auch der deutlichste Vorbehalt: Es ist eine frühe Vorschau mit ausdrücklich noch beweglicher Programmierschnittstelle.
Bemerkenswert ist der erklärte Umgang mit der Konkurrenz, gegen die gemessen wurde: „We are also working with the ONNX Runtime team to upstream these improvements so they can benefit the broader ONNX Runtime Web ecosystem.“ Wer den Vergleich gewinnt und die Gewinne zugleich in das unterlegene Projekt zurückgeben will, misst nicht primär gegen einen Wettbewerber, sondern gegen den eigenen Ausgangszustand. ⚠️ Eine unabhängige Nachmessung auf anderer Hardware gibt es bislang nicht; alle hier genannten Beschleunigungswerte stammen aus dem Beitrag des Anbieters.