Agent Evaluation Metric: jak złapać błędy w wieloturowych rozmowach AI
Agenty konwersacyjne mają problem: jeden błąd na początku rozmowy psuje wszystko, co przychodzi później, a standardowe metryki to przegapią. Artykuł przedstawia Agent Evaluation Metric (AEM), narzędzie do analizy na poziomie każdej tury, które pozwala precyzyjnie wskazać, gdzie agent się pomylił i oddzielić pierwotny błąd od jego konsekwencji.
źródło: [aws/machine-learning-blog]