ewaluacja trajektorii

Ocena całej sekwencji kroków agenta — planów, wywołań narzędzi, interpretacji i decyzji — a nie tylko końcowej odpowiedzi. Łapie agenta, który dał dobry wynik złą drogą.

W Polsce nazywane też:

ocena trajektoriiewaluacja ścieżki agenta

Agent dał dobrą odpowiedź — ale czy doszedł do niej właściwą drogą? Ewaluacja trajektorii to pytanie, którego sam wynik końcowy nie zadaje.

Czym jest ewaluacja trajektorii

Ewaluacja trajektorii to ocena całej sekwencji kroków agenta — planów, wywołań narzędzi z parametrami, interpretacji wyników i decyzji o następnym kroku — a nie tylko końcowej odpowiedzi. Trajektoria to ślad, który agent zostawia, przechodząc przez pętlę ReAct od zadania do wyniku.

Dlaczego wynik to za mało

Agent może osiągnąć dobry wynik złą drogą: zgadnąć parametr narzędzia, który przypadkiem zadziałał; wykonać osiem kroków tam, gdzie wystarczały trzy; albo zapętlić się i mimo to trafić. We wszystkich tych przypadkach metryka task completion pokazuje sukces, a agent jest faktycznie kruchy — przy pierwszym odchyleniu od testowanego scenariusza zawiedzie.

Trzy wymiary oceny

Trafność kroków — czy agent szedł właściwą ścieżką (porównanie z oczekiwaną trajektorią),
Efektywność — stosunek kroków wykonanych do minimalnych; poniżej 0,5 to sygnał ostrzegawczy,
Jakość parametrów — czy agent wydedukował parametry narzędzi z kontekstu, czy je zgadł lub zhalucynował.

Warunek konieczny

Ewaluacja trajektorii jest niemożliwa bez logowania kroków pośrednich. Standardowe logowanie input → output wystarcza do task completion, ale nie do oceny drogi. Trzeba zapisywać każdy obrót pętli.