Pętla agenta jest domyślnie sekwencyjna: jedno wywołanie modelu, jedno narzędzie, kolejne wywołanie modelu. Przy trzech niezależnych rzeczach do sprawdzenia daje to trzy pełne obroty i trzykrotność opóźnienia.
Czym są wywołania równoległe
Współczesne modele potrafią w jednej odpowiedzi poprosić o kilka wywołań naraz. Pętla może wtedy wykonać je równolegle, a wszystkie wyniki dopisać do kontekstu przed kolejnym wywołaniem modelu. Zamiast trzech obrotów wystarczy jeden.
Warunek: niezależność
Zrównoleglić da się wyłącznie wywołania, które nie potrzebują nawzajem swoich wyników. Jeśli drugie zapytanie wymaga identyfikatora zwróconego przez pierwsze, model i tak poprosi o nie osobno, w kolejnym obrocie — i słusznie.
Dlaczego to opłacalna optymalizacja
Skraca czas odpowiedzi, nie pogarszając niczego innego, i jednocześnie obniża koszt: mniej obrotów to mniej powtórzeń całego rosnącego kontekstu. To rzadki przypadek, w którym szybciej znaczy też taniej.
Na co uważać
Wywołania równoległe wykonują się bez pośredniej kontroli modelu, więc walidacja argumentów i sprawdzenie uprawnień muszą objąć każde z nich osobno. Przy narzędziach o skutkach ubocznych warto ograniczyć równoległość do operacji wyłącznie odczytujących — równoległy zapis wprowadza problemy z kolejnością i z powtórzeniami, których model nie kontroluje.