Poprzedni wpis kończył się wnioskiem, że trzeba pytać rzadziej. To brzmi jak nowy postulat dla agentów. Nie jest nowym postulatem. Ktoś to już próbował — pięć razy, przez przynajmniej czterdzieści lat, na miliardach ludzi. I za każdą z tych prób ktoś zapłacił...
Naprawiłeś okno zgody. Pokazuje rozwiązaną ścieżkę, realny skutek, ostrzeżenie przy akcji wychodzącej poza projekt. Wszystko zgodnie z checklistą. I właśnie dlatego przestało chronić. W poprzednim wpisie tej serii opisałem punkt kontrolny, który kłamie: okno zgody...
Dodałeś potwierdzenie przez człowieka. To nie znaczy, że dodałeś zabezpieczenie. Kiedy budujesz agenta, który robi coś nieodwracalnego — pisze pliki, wykonuje polecenia, wysyła pieniądze — prędzej czy później dokładasz punkt kontrolny: zanim agent to zrobi, pyta...
Na szkoleniu powiedzieli: podepnij agentowi skrzynkę i niech wysyła wyceny. To brzmi prosto. Jest jednym z trudniejszych przypadków użycia agenta. Zadanie wydaje się oczywiste: klient pisze zapytanie, agent czyta, generuje wycenę, wysyła. Jeden przepływ, zero...
Przeszedł wszystkie testy przed wdrożeniem. Tydzień później provider po cichu zaktualizował model. Nikt Ci o tym nie powiedział. Artykuł 9 serii i dwa poprzednie wpisy tego wątku — ewaluacja trajektorii i ewaluacja w n8n — dotyczyły jednego momentu: przed wdrożeniem....
Cały internet o ewaluacji agentów zakłada, że umiesz pisać testy w Pythonie. A Ty zbudowałeś agenta w n8n i nie masz żadnego „evaluate.py”. I to też jest OK. Artykuł 9 serii dał solidne fundamenty ewaluacji — metryki, zestaw testowy, LLM-as-judge, CI/CD. Ale...