Model nie pamięta ani jednego słowa z waszej poprzedniej wymiany. Wagi są zamrożone, między turami nie zapisuje się nic, a wrażenie ciągłości powstaje przez mechanizm tak prosty, że po jego poznaniu przestaje dziwić połowa rzeczy z tej serii — łącznie z rachunkiem za...
Okno czatu wygląda jak najkrótsza możliwa droga do modelu, a jest najdłuższą. Między twoim zdaniem a wagami stoi więcej warstw niż w wywołaniu API — i żadnej z nich nie widzisz, nie ustawiasz i nie możesz wyłączyć. W poprzednim torze rozkładaliśmy to, co dzieje się na...
Cennik API wygląda jak cennik produktu, a jest cennikiem czasu na karcie. Dwie kolumny, wejście i wyjście, różnica trzy- do pięciokrotnej — i żadna z tych liczb nie mówi o modelu. Mówią o tym, ile miejsca zajmujesz w partii i jak długo je blokujesz. To zamknięcie toru...
Jest jedna optymalizacja, która potrafi ściąć rachunek za API o dwie trzecie, nie wymaga zmiany modelu ani frameworka i mieści się w jednej decyzji o kolejności tekstu. Jest też jedna rzecz, która ją unieważnia — i prawie każdy popełnia ten błąd przynajmniej raz. W...
Twoja prośba nie jest obsługiwana sama. Dzieli kartę z kilkudziesięcioma innymi i to nie jest oszczędność dostawcy — to jedyny sposób, żeby rachunek w ogóle się domknął. Wszystko, co odczuwasz jako dziwactwa API, wynika z tej jednej decyzji: kolejka, wahania czasu...
Między twoim fetch a pierwszym bajtem odpowiedzi stoi sześć warstw, z których tylko jedna jest modelem — a i ona dzieli się na dwie fazy o zupełnie różnym charakterze. Przez cztery poprzednie artykuły oglądaliśmy mechanizm na własnym urządzeniu, gdzie wszystko było...