Jeśli stu użytkowników zadaje to samo pytanie innymi słowami, model liczy stu odpowiedzi. Cache semantyczny próbuje policzyć jedną.
Czym jest
Pamięć podręczna, w której kluczem nie jest dokładna treść zapytania, lecz jego znaczenie. Pytanie jest zamieniane na wektor i porównywane z wektorami pytań już obsłużonych. Jeśli podobieństwo przekracza próg, zwracana jest zapisana odpowiedź, bez wywoływania modelu.
Czym różni się od cache promptu
To dwa zupełnie różne mechanizmy, często mylone. Cache promptu działa wewnątrz modelu i zmniejsza koszt przetworzenia powtarzalnego początku sekwencji — odpowiedź nadal jest generowana. Cache semantyczny działa przed modelem i sprawia, że odpowiedź nie jest generowana wcale.
Ryzyko, które trzeba rozumieć
Próg podobieństwa decyduje o wszystkim. Ustawiony zbyt luźno, zwraca odpowiedź na pytanie podobne, ale nie to samo — a użytkownik nie ma jak tego zauważyć, bo odpowiedź brzmi sensownie. To ten sam problem, który sprawia, że wyszukiwanie semantyczne myli zdanie z jego zaprzeczeniem.
Szczególnie niebezpieczne są pytania różniące się jednym szczegółem: liczbą, datą, nazwą wariantu produktu. W przestrzeni znaczeń leżą blisko siebie, a odpowiedzi mają zupełnie inne.
Kiedy stosować
Sprawdza się przy powtarzalnych pytaniach o rzeczy niezmienne — bazy wiedzy, dokumentacja, często zadawane pytania. Nie nadaje się tam, gdzie odpowiedź zależy od użytkownika, od stanu systemu albo od czasu.
Warto trzymać cache osobno dla każdego użytkownika lub kontekstu uprawnień, inaczej mechanizm staje się drogą wycieku danych między kontami.