Jak testować infrastrukturę dla systemów AI
Wydajność systemu jest wynikiem całego stosu: modelu, pamięci, runtime, kolejek, storage, sieci i profilu obciążenia. Test pojedynczego komponentu nie opisuje zachowania całej usługi.
Zdefiniuj workload
Przed pomiarem określ model, długość wejścia i wyjścia, kontekst, batch, równoległość oraz rodzaj pracy: interaktywną, batchową lub mieszaną. To pozwala odtworzyć warunki i porównywać zmiany.
| Metryka | Znaczenie |
|---|---|
| Latency | Czas wykonania pojedynczego zadania i zachowanie ogona rozkładu. |
| Throughput | Ile zadań system wykonuje przy docelowej równoległości. |
| Pamięć | Zużycie RAM/VRAM przy modelu, kontekście i batchu. |
| Nasycenie | Moment, w którym kolejki rosną szybciej niż system wykonuje pracę. |
| Stabilność | Zachowanie podczas dłuższego obciążenia i po błędach. |
Test długotrwały
Krótki benchmark może nie ujawnić wycieku pamięci, narastania kolejki, throttlingu lub problemu z odtwarzaniem po awarii. Długi test powinien obejmować docelowy profil obciążenia i obserwację zasobów.
Test odtwarzania
Sprawdź restart procesu, hosta lub zależności, czas powrotu usługi i zachowanie oczekujących zadań. Dostępność to nie tylko brak awarii, ale również przewidywalny sposób odzyskania działania.
Porównywalność wyniku
Zmiana modelu, runtime, sterownika, parametrów, limitu mocy, danych lub sprzętu tworzy nowy wariant testu. Wynik powinien zawsze wskazywać, które elementy pozostały stałe.
Źródła referencyjne
- NIST AI Risk Management Framework 1.0 — ocena i zarządzanie ryzykiem systemów AI.
- NIST Cybersecurity Framework 2.0 — zarządzanie ryzykiem i odpornością systemów.