transformer

Architektura sieci neuronowej oparta na mechanizmie uwagi, opisana w 2017 roku i stanowiąca podstawę dzisiejszych dużych modeli. Przetwarza całą sekwencję równolegle, co umożliwiło trening na dużą skalę. Wagi są zamrożone po treningu — model nie zapisuje niczego podczas rozmowy.

W Polsce nazywane też:

architektura transformersieć transformerowa

Transformer to architektura, na której zbudowane są praktycznie wszystkie dzisiejsze duże modele. Jej kluczowa zaleta jest banalna: da się ją policzyć równolegle.

Czym jest transformer

Transformer to architektura sieci neuronowej opisana w 2017 roku, oparta na mechanizmie uwagi. Zbudowana jest z powtarzalnych bloków, przez które przechodzą wektory tokenów. Każdy blok zawiera warstwę uwagi, która pozwala tokenom „patrzeć” na siebie nawzajem, oraz warstwę w pełni połączoną, która przetwarza każdą pozycję osobno. Duży model to kilkadziesiąt lub więcej takich bloków ułożonych jeden na drugim.

Dlaczego wyparł wcześniejsze architektury

Poprzednie podejścia przetwarzały tekst sekwencyjnie, słowo po słowie, co uniemożliwiało efektywne zrównoleglenie treningu. Transformer przetwarza całą sekwencję naraz, dzięki czemu daje się trenować na dużo większych zbiorach przy tym samym czasie. To nie była przewaga jakościowa nad wcześniejszymi pomysłami, tylko przewaga skali — i ona okazała się decydująca.

Wagi są zamrożone po treningu

Po zakończeniu treningu parametry transformera się nie zmieniają. Podczas rozmowy w modelu nie zapisuje się nic — wszystko, co wygląda na uczenie się w trakcie, jest wyłącznie zawartością okna kontekstu. To architektoniczna przyczyna, dla której pamięć agenta trzeba budować na zewnątrz.

Ograniczenie, które z tego wynika

Mechanizm uwagi porównuje każdy token z każdym, więc nakład obliczeń rośnie kwadratowo wraz z długością sekwencji. Stąd bierze się koszt długiego kontekstu i cała rodzina technik, które próbują ten koszt obejść.

mechanizm uwagiMechanizm, w którym reprezentacja każdego tokenu jest aktualizowana na podstawie pozostałych tokenów sekwencji, według wyliczonych wag. Działa równolegle w wielu głowach. Porównuje każdą pozycję z każdą, więc koszt rośnie kwadratowo z długością kontekstu.pamięć podręczna klucz-wartośćPamięć podręczna przechowująca pośrednie reprezentacje dotychczasowych tokenów, dzięki której generowanie kolejnego tokenu nie wymaga przeliczania całej sekwencji. Rośnie liniowo z długością kontekstu i liczbą sesji — to główny konsument pamięci przy inference. Podstawa mechanizmu cache promptu.predykcja następnego tokenuJedyna operacja, jaką wykonuje model: na podstawie ciągu tokenów zwraca rozkład prawdopodobieństwa kolejnego tokenu. Odpowiedź powstaje przez powtarzanie tego kroku. Model niczego nie wykonuje i nie sięga poza kontekst — halucynacje i brak pamięci wynikają wprost z tego mechanizmu.Model bazowyDuży model AI trenowany na ogromnych zbiorach danych służący jako fundament dla szerokiego zakresu zastosowań — przez fine-tuning lub prompting. GPT-4o, Claude, Gemini, Llama to foundation models. AI Act definiuje je jako GPAI z konkretnymi obowiązkami dla dostawców.Osadzenie wektoroweNumeryczna reprezentacja tekstu w wielowymiarowej przestrzeni wektorowej, gdzie podobne znaczeniowo obiekty mają bliskie wektory — fundament wyszukiwania semantycznego i RAG. Termin obejmuje dwie różne rzeczy: wiersz macierzy embeddingów wskazywany numerem tokenu wewnątrz modelu językowego oraz wektor całego tekstu zwracany przez osobny model embeddingowy.