WebGPU

Standard W3C dający stronom internetowym dostęp do karty graficznej użytkownika, zarówno do grafiki, jak i do obliczeń ogólnego przeznaczenia. Dla modeli językowych oznacza możliwość uruchomienia inferencji lokalnie z akceleracją sprzętową, bez wysyłania czegokolwiek na serwer.

W Polsce nazywane też:

WebGPUAPI grafiki i obliczeń w przeglądarceobliczenia na GPU w przeglądarce

Przez dwadzieścia lat strona internetowa nie miała jak policzyć niczego poważnego. Procesor przeglądarki wystarczał do interfejsu i nie do niczego więcej.

Czym jest WebGPU

WebGPU to standard W3C udostępniający stronom internetowym kartę graficzną użytkownika — zarówno do renderowania grafiki, jak i do obliczeń ogólnego przeznaczenia realizowanych przez tak zwane shadery obliczeniowe. Jest następcą WebGL, zaprojektowanym wokół nowoczesnych interfejsów sprzętowych i, w odróżnieniu od poprzednika, nadającym się do zadań niegraficznych.

Dlaczego to zmienia sytuację modeli

Inferencja modelu językowego to w większości mnożenie macierzy, czyli dokładnie ten typ pracy, do którego karta graficzna została zbudowana. Bez dostępu do niej model w przeglądarce działa na procesorze i jest wolniejszy o rząd wielkości.

Z WebGPU model kilkumiliardowy w niskiej precyzji działa na przeciętnym laptopie na tyle sprawnie, żeby nadawał się do zadań praktycznych — streszczania, klasyfikacji, wyszukiwania semantycznego.

Co z tego wynika dla stron

Inferencja przestaje wymagać serwera. Dane nie opuszczają urządzenia, koszt tokenu wynosi zero, a funkcja działa bez połączenia z siecią.

Cena jest inna: użytkownik musi raz pobrać model, co przy wariantach użytecznych oznacza setki megabajtów, a przy większych — gigabajty.

Ograniczenia

Wsparcie przeglądarek różni się między systemami operacyjnymi i wersjami, więc wykrycie obecności interfejsu i ścieżka zapasowa są obowiązkowe. Pamięć karty jest wspólna z resztą systemu, a dłuższa praca na urządzeniu mobilnym prowadzi do ograniczania wydajności z powodu temperatury.

Transformers.jsBiblioteka JavaScript uruchamiająca modele uczenia maszynowego bezpośrednio w przeglądarce, na warstwie środowiska uruchomieniowego ONNX z akceleracją WebGPU. Obsługuje nie tylko modele językowe, ale też embeddingi, rozpoznawanie mowy, syntezę mowy i zadania wizyjne.WebAssemblyBinarny format kodu wykonywanego przez przeglądarkę z wydajnością zbliżoną do natywnej. Dla modeli AI pełni rolę ścieżki zapasowej tam, gdzie nie ma dostępu do karty graficznej — wolniejszej od WebGPU, ale działającej praktycznie wszędzie.WebNNProjektowany standard W3C dający stronom bezpośredni dostęp do sprzętowych akceleratorów sieci neuronowych, w tym układów NPU w nowszych urządzeniach. Obiecuje wyższą wydajność i niższy pobór energii niż WebGPU, ale w 2026 roku nie jest jeszcze powszechnie dostępny.akcelerator obliczeniowyUkład zaprojektowany do wykonywania wielu prostych operacji równolegle — karta graficzna, TPU lub NPU. Dla modeli językowych liczą się w nim dwa parametry osobno: moc obliczeniowa, która rządzi przetwarzaniem promptu, i przepustowość pamięci, która rządzi generowaniem odpowiedzi.przepustowość pamięciIlość danych, jaką sprzęt przepycha między pamięcią a rdzeniami w ciągu sekundy. Przy generowaniu odpowiedzi to ona, a nie moc obliczeniowa, wyznacza sufit prędkości — bo każdy pojedynczy token wymaga przeczytania wszystkich wag modelu.Lokalny model językowyModel językowy uruchamiany lokalnie — bez zewnętrznego API — zapewniający prywatność danych, działanie offline i przewidywalne koszty. Llama, Mistral, Phi jako popularne modele. Ollama jako de facto standard dla developerów.