Pytanie o to, ile trwa odpowiedź z API, jest źle postawione. Nie ma jednej liczby, są trzy i mierzą różne rzeczy.
Czym jest czas do pierwszego tokena
Czas do pierwszego tokena, w skrócie TTFT, to metryka mierząca odstęp między wysłaniem żądania a otrzymaniem pierwszego fragmentu odpowiedzi. Obejmuje drogę sieciową, uwierzytelnienie w bramie, wybór maszyny, czekanie w kolejce na miejsce w partii oraz przetworzenie promptu.
Dla użytkownika siedzącego przed ekranem jest to jedyna metryka, która się liczy.
Trzy metryki, nie jedna
TTFT mierzy ciszę po naciśnięciu przycisku i zależy głównie od długości promptu oraz od obciążenia dostawcy.
Liczba tokenów na sekundę mierzy tempo generowania i zależy od rozmiaru modelu, przepustowości pamięci i liczby rozmów dzielących z tobą kartę.
Czas całkowity jest sumą obu i ma sens przy zadaniach wsadowych, gdzie nikt nie patrzy na ekran.
Dlaczego bywają sprzeczne
Dostawca upychający więcej rozmów w jednej partii poprawia przepustowość całego systemu i pogarsza czas do pierwszego tokena, bo twoja prośba czeka na skompletowanie partii. Dostawca przetwarzający żądania natychmiast marnuje sprzęt i musi to odbić w cenie.
Stąd bierze się zjawisko wyglądające na sprzeczność w porównaniach: ten sam dostawca bywa najszybszy w jednym teście i najwolniejszy w drugim. Testy mierzyły różne metryki na zadaniach o różnym profilu.
Co z tym zrobić
Przy wyborze dostawcy zmierz obie metryki na własnym profilu ruchu, nie na cudzym benchmarku. Jeśli twoje zadania mają krótkie prompty i długie odpowiedzi, TTFT jest prawie bez znaczenia. Jeśli wysyłasz długie dokumenty, TTFT jest całym problemem.
Streaming nie przyspiesza niczego — maskuje czas generowania, którego nie da się usunąć. Nie maskuje natomiast ciszy przed pierwszym tokenem.