silnik wnioskowania

Program, który wczytuje plik z wagami, kompiluje graf obliczeniowy pod konkretny sprzęt, rezerwuje pamięć i wykonuje pętlę generowania. Ten sam model uruchomiony przez dwa różne runtime'y daje tę samą odpowiedź w czasie różniącym się wielokrotnie.

W Polsce nazywane też:

runtime inferencyjnysilnik wnioskowaniasilnik inferencyjnyśrodowisko uruchomieniowe modelu

Plik z wagami jest martwy. Nie ma w nim pętli, warunków ani niczego, co samo się uruchomi. Między nim a odpowiedzią stoi program — i to on jest odpowiedzialny za prawie wszystko, co odczuwasz jako zachowanie modelu.

Czym jest runtime inferencyjny

Runtime inferencyjny to oprogramowanie wykonujące wytrenowany model: wczytuje wagi, kompiluje graf obliczeniowy pod konkretną architekturę sprzętu, rezerwuje pamięć na wagi, bufory robocze i pamięć podręczną kontekstu, a następnie wykonuje pętlę generowania token po tokenie. Najpopularniejsze implementacje to llama.cpp, vLLM, ONNX Runtime i TensorRT-LLM.

Cztery zadania runtime’u

Wczytanie wag — zwykle przez mapowanie pliku, nie kopiowanie. Dlatego pierwsze uruchomienie po restarcie maszyny trwa, a kolejne są natychmiastowe.

Kompilacja planu — przepisanie grafu na jądra obliczeniowe napisane pod konkretną architekturę. Tu następuje fuzja operatorów i tu powstaje większość różnicy w prędkości między implementacjami.

Alokacja pamięci — z góry, całej, zanim padnie pierwszy token.

Wykonanie pętli — wraz z samplingiem, warunkami zatrzymania i strumieniowaniem wyniku.

Czego runtime robi więcej, niż się wydaje

Temperatura nie jest zapisana w wagach. Model zwraca rozkład prawdopodobieństwa nad całym słownikiem — to runtime losuje z tego rozkładu jeden token, według reguł, które mu ustawisz. To samo dotyczy sekwencji zatrzymujących, kary za powtórzenia, limitu długości odpowiedzi i tego, czy wynik przychodzi w całości, czy strumieniem.

Zmieniając temperaturę, nie zmieniasz modelu. Zmieniasz ustawienie programu, który model odczytuje.

Dlaczego nazwa modelu nie wystarcza

Kiedy dostawca deklaruje, że serwuje konkretny model, podaje jedną informację z czterech. Nie wiesz, w jakiej precyzji trzyma wagi, jakim runtime’em je wykonuje, jak agresywnie fuzjuje operacje ani na jakim sprzęcie to stoi.

Te same wagi obsłużone przez dwie różne maszynerie dają odpowiedzi tej samej jakości w czasie różniącym się o rząd wielkości. Porównywanie dostawców po nazwie modelu jest jak porównywanie restauracji po tym, że obie mają w karcie to samo danie.

graf obliczeniowyZapisany w pliku modelu opis kolejności operacji: co przez co pomnożyć, co dodać, co znormalizować. Mówi, co ma wyjść, ale nie mówi, jak to policzyć — dopisanie tej drugiej warstwy jest zadaniem runtime'u i to w niej powstaje większość różnicy w wydajności.wnioskowanie modeluUżycie wytrenowanego modelu do wygenerowania odpowiedzi, przy zamrożonych wagach. Dzieli się na przetworzenie promptu i sekwencyjne generowanie token po tokenie — stąd różne stawki za tokeny wejściowe i wyjściowe oraz to, że długa odpowiedź kosztuje czasowo więcej niż długi prompt.próbkowanieWarstwa wybierająca jeden token z rozkładu prawdopodobieństwa zwróconego przez model. Sterowana temperaturą, top-p i top-k. Odpowiada za niepowtarzalność odpowiedzi — ale nie zmienia wiedzy modelu, więc nie usuwa halucynacji.Infrastruktura wnioskowania modeliSprzęt i oprogramowanie dedykowane do uruchamiania modeli AI w czasie rzeczywistym — GPU accelerators, batching, quantization, model serving — odpowiadające na żądania z odpowiednią latencją i kosztem. Własna infrastruktura uzasadniona przy dużych wolumenach lub wymaganiach data sovereignty.Lokalny model językowyModel językowy uruchamiany lokalnie — bez zewnętrznego API — zapewniający prywatność danych, działanie offline i przewidywalne koszty. Llama, Mistral, Phi jako popularne modele. Ollama jako de facto standard dla developerów.Agent hostowany lokalnieAgent AI działający na infrastrukturze organizacji bez zewnętrznych wywołań API — model wdrożony lokalnie lub w prywatnej chmurze, dane nigdy nie opuszczają organizacji. Kluczowe dla regulowanych branż i danych wrażliwych. Llama, Mistral, Phi jako popularne modele open-source.