TERVYXA SYSTEMS
METODOLOGIA POMIARU

Metodologia benchmarków AI

Benchmark ma wartość dopiero wtedy, gdy można odtworzyć warunki testu i jednoznacznie zinterpretować metrykę.

1. Zdefiniuj hipotezę

Przed testem zapisz, co dokładnie ma zostać sprawdzone. „Ten wariant jest lepszy” to za mało. Hipoteza powinna wskazywać mierzalną różnicę, np. czas, jakość, zużycie pamięci lub odporność na określony typ błędu.

2. Ustal baseline i zmienną

Porównanie wymaga punktu odniesienia. Zmieniaj jeden istotny element naraz, jeżeli chcesz przypisać wynik konkretnej zmianie. Jeśli jednocześnie zmieniasz model, runtime i sprzęt, otrzymujesz porównanie całych konfiguracji, a nie izolowanej zmiennej.

3. Zapisz środowisko

  • Model, wariant, format i wersja.
  • Runtime, biblioteki i parametry uruchomienia.
  • Sprzęt, pamięć i ustawienia wpływające na wynik.
  • Rozmiar kontekstu, batch i równoległość.
  • Dane wejściowe lub sposób ich wygenerowania.

4. Dobierz metrykę

WarstwaPrzykładowe metryki
LLMlatencja, throughput, poprawność zadania, błędy krytyczne
Retrievalrecall@k, MRR, trafność TOP-k
RerankingNDCG, TOP1 accuracy, latencja
Workflowsuccess rate, retry rate, czas end-to-end, liczba wyjątków

5. Wykonaj powtórzenia

Jeden pomiar może być przypadkowy. Liczba powtórzeń i sposób agregacji powinny być częścią opisu wyniku. Przy pomiarach wydajności warto również odnotować rozrzut, nie tylko najlepszą wartość.

6. Opisz ograniczenia

Wynik jest prawdziwy dla opisanych warunków, nie dla wszystkich możliwych środowisk. Dokumentuj czynniki, które mogą ograniczać możliwość przeniesienia wniosku na inny model, sprzęt lub workload.

Kiedy wynik nadaje się do publikacji

Gdy metoda, środowisko i dane są opisane wystarczająco, aby czytelnik zrozumiał, co zostało zmierzone i czego wynik nie dowodzi.