zestaw referencyjny

Referencyjny zestaw testów z oczekiwanymi odpowiedziami i kryteriami sukcesu, służący jako baseline jakości agenta. Uruchamiany przed i po zmianie, by wykryć poprawę lub regresję.

W Polsce nazywane też:

zestaw referencyjnyzestaw testowyzestaw złoty

Bez punktu odniesienia nie wiesz, czy zmiana w agencie była poprawą czy regresją. Golden set jest tym punktem odniesienia.

Czym jest golden set

Golden set to referencyjny zestaw testów — pytań z oczekiwanymi odpowiedziami i kryteriami sukcesu — który służy jako baseline jakości agenta. Uruchamiasz go przed zmianą i po zmianie; różnica w wynikach mówi, czy poprawiłeś agenta, czy go popsułeś.

Jak go zbudować

Minimalny golden set dla agenta produkcyjnego to 20–30 przykładów pokrywających różne sytuacje: typowe przypadki (~40%), edge case (~30%), przypadki błędów (~20%) i adversarial, np. próby prompt injection (~10%). Każdy wpis definiuje wejście, oczekiwany wynik, kryterium sukcesu i kategorię.

Żywy, nie statyczny

Golden set rośnie. Każdy rzeczywisty incydent z produkcji — pytanie, na którym agent zawiódł, eskalacja, nowa kategoria zapytań — to kandydat na nowy wiersz. Im dłużej agent działa, tym lepszy ma zestaw testowy, bo uczy się na własnych porażkach.

Dla builderów no-code

Golden set nie wymaga kodu — wystarczy arkusz Google z kolumnami wejście / oczekiwany wynik / kryterium / kategoria. To czyni go dostępnym także dla agentów budowanych w n8n, bez frameworka testowego.