Bez punktu odniesienia nie wiesz, czy zmiana w agencie była poprawą czy regresją. Golden set jest tym punktem odniesienia.
Czym jest golden set
Golden set to referencyjny zestaw testów — pytań z oczekiwanymi odpowiedziami i kryteriami sukcesu — który służy jako baseline jakości agenta. Uruchamiasz go przed zmianą i po zmianie; różnica w wynikach mówi, czy poprawiłeś agenta, czy go popsułeś.
Jak go zbudować
Minimalny golden set dla agenta produkcyjnego to 20–30 przykładów pokrywających różne sytuacje: typowe przypadki (~40%), edge case (~30%), przypadki błędów (~20%) i adversarial, np. próby prompt injection (~10%). Każdy wpis definiuje wejście, oczekiwany wynik, kryterium sukcesu i kategorię.
Żywy, nie statyczny
Golden set rośnie. Każdy rzeczywisty incydent z produkcji — pytanie, na którym agent zawiódł, eskalacja, nowa kategoria zapytań — to kandydat na nowy wiersz. Im dłużej agent działa, tym lepszy ma zestaw testowy, bo uczy się na własnych porażkach.
Dla builderów no-code
Golden set nie wymaga kodu — wystarczy arkusz Google z kolumnami wejście / oczekiwany wynik / kryterium / kategoria. To czyni go dostępnym także dla agentów budowanych w n8n, bez frameworka testowego.