Agent dał dobrą odpowiedź — ale czy doszedł do niej właściwą drogą? Ewaluacja trajektorii to pytanie, którego sam wynik końcowy nie zadaje.
Czym jest ewaluacja trajektorii
Ewaluacja trajektorii to ocena całej sekwencji kroków agenta — planów, wywołań narzędzi z parametrami, interpretacji wyników i decyzji o następnym kroku — a nie tylko końcowej odpowiedzi. Trajektoria to ślad, który agent zostawia, przechodząc przez pętlę ReAct od zadania do wyniku.
Dlaczego wynik to za mało
Agent może osiągnąć dobry wynik złą drogą: zgadnąć parametr narzędzia, który przypadkiem zadziałał; wykonać osiem kroków tam, gdzie wystarczały trzy; albo zapętlić się i mimo to trafić. We wszystkich tych przypadkach metryka task completion pokazuje sukces, a agent jest faktycznie kruchy — przy pierwszym odchyleniu od testowanego scenariusza zawiedzie.
Trzy wymiary oceny
– Trafność kroków — czy agent szedł właściwą ścieżką (porównanie z oczekiwaną trajektorią),
– Efektywność — stosunek kroków wykonanych do minimalnych; poniżej 0,5 to sygnał ostrzegawczy,
– Jakość parametrów — czy agent wydedukował parametry narzędzi z kontekstu, czy je zgadł lub zhalucynował.
Warunek konieczny
Ewaluacja trajektorii jest niemożliwa bez logowania kroków pośrednich. Standardowe logowanie input → output wystarcza do task completion, ale nie do oceny drogi. Trzeba zapisywać każdy obrót pętli.