akcelerator obliczeniowy

Układ zaprojektowany do wykonywania wielu prostych operacji równolegle — karta graficzna, TPU lub NPU. Dla modeli językowych liczą się w nim dwa parametry osobno: moc obliczeniowa, która rządzi przetwarzaniem promptu, i przepustowość pamięci, która rządzi generowaniem odpowiedzi.

W Polsce nazywane też:

akceleratorakcelerator obliczeniowykarta obliczeniowaukład przyspieszający

Operacja, którą model wykonuje miliardy razy na jeden token, jest trywialna: pomnóż, dodaj. Trudność nie leży w skomplikowaniu, tylko w liczbie powtórzeń. Procesor ogólnego przeznaczenia ma kilkanaście bardzo uniwersalnych rdzeni. Akcelerator ma tysiące bardzo wyspecjalizowanych.

Czym jest akcelerator

Akcelerator to układ scalony zaprojektowany do równoległego wykonywania wielu prostych operacji arytmetycznych, przede wszystkim mnożenia macierzy. W praktyce oznacza to kartę graficzną, układ TPU po stronie Google albo NPU wbudowany w procesor urządzenia końcowego.

Dwa parametry, nie jeden

Karty opisuje się zwykle mocą obliczeniową w bilionach operacji na sekundę. Ta liczba jest myląca, jeśli czytać ją samą, bo dla modeli językowych liczą się dwa parametry i rządzą one dwiema różnymi fazami pracy.

Moc obliczeniowa decyduje o tempie przetwarzania promptu, czyli o tym, jak długo trwa cisza po wysłaniu zapytania.

Przepustowość pamięci decyduje o tempie generowania odpowiedzi, czyli o tym, ile tokenów na sekundę zobaczysz w strumieniu.

Te dwie wartości nie skalują się razem. Przechodząc z układu zintegrowanego na kartę serwerową zyskujesz zwykle kilkadziesiąt razy więcej mocy obliczeniowej i kilkadziesiąt razy większą przepustowość, ale w różnych proporcjach — i dlatego wykorzystanie karty przy generowaniu spada, im droższy sprzęt kupisz.

Rodzaje pamięci

Karty konsumenckie używają pamięci typu GDDR, dające rzędu 500–1000 GB/s. Karty serwerowe używają pamięci HBM montowanej bezpośrednio przy układzie, co pozwala przekroczyć 3000 GB/s. Urządzenia z pamięcią współdzieloną między procesorem a układem graficznym — laptopy Apple, zintegrowane układy — mieszczą się w przedziale 80–400 GB/s, za to nie mają osobnego limitu na rozmiar modelu.

Marnotrawstwo przy generowaniu

Karta obsługująca jedną rozmowę w fazie generowania wykorzystuje od jednego do trzech procent swojej mocy obliczeniowej. Reszta czeka, aż wagi dojadą z pamięci. To nie jest wada implementacji — to bezpośrednia konsekwencja tego, że jeden token wymaga odczytu całego modelu przy minimalnej liczbie obliczeń.

Z tego marnotrawstwa wyrosła cała ekonomia serwowania modeli: skoro rdzenie i tak stoją, dostawca upycha w jedną kartę tyle równoległych rozmów, ile się da.