Metodologia benchmarków AI
Benchmark ma wartość dopiero wtedy, gdy można odtworzyć warunki testu i jednoznacznie zinterpretować metrykę.
1. Zdefiniuj hipotezę
Przed testem zapisz, co dokładnie ma zostać sprawdzone. „Ten wariant jest lepszy” to za mało. Hipoteza powinna wskazywać mierzalną różnicę, np. czas, jakość, zużycie pamięci lub odporność na określony typ błędu.
2. Ustal baseline i zmienną
Porównanie wymaga punktu odniesienia. Zmieniaj jeden istotny element naraz, jeżeli chcesz przypisać wynik konkretnej zmianie. Jeśli jednocześnie zmieniasz model, runtime i sprzęt, otrzymujesz porównanie całych konfiguracji, a nie izolowanej zmiennej.
3. Zapisz środowisko
- Model, wariant, format i wersja.
- Runtime, biblioteki i parametry uruchomienia.
- Sprzęt, pamięć i ustawienia wpływające na wynik.
- Rozmiar kontekstu, batch i równoległość.
- Dane wejściowe lub sposób ich wygenerowania.
4. Dobierz metrykę
| Warstwa | Przykładowe metryki |
|---|---|
| LLM | latencja, throughput, poprawność zadania, błędy krytyczne |
| Retrieval | recall@k, MRR, trafność TOP-k |
| Reranking | NDCG, TOP1 accuracy, latencja |
| Workflow | success rate, retry rate, czas end-to-end, liczba wyjątków |
5. Wykonaj powtórzenia
Jeden pomiar może być przypadkowy. Liczba powtórzeń i sposób agregacji powinny być częścią opisu wyniku. Przy pomiarach wydajności warto również odnotować rozrzut, nie tylko najlepszą wartość.
6. Opisz ograniczenia
Wynik jest prawdziwy dla opisanych warunków, nie dla wszystkich możliwych środowisk. Dokumentuj czynniki, które mogą ograniczać możliwość przeniesienia wniosku na inny model, sprzęt lub workload.
Gdy metoda, środowisko i dane są opisane wystarczająco, aby czytelnik zrozumiał, co zostało zmierzone i czego wynik nie dowodzi.