Compute
CPU i GPU dobierane do typu obciążenia: inferencja, embedding, reranking, preprocessing lub zadania asynchroniczne.
CPU, GPU, pamięć, storage i sieć są tylko zasobami. Dobra architektura zaczyna się od wymagań: wielkości modeli, kontekstu, liczby użytkowników, opóźnienia, dostępności, prywatności i kosztu operacyjnego.
CPU i GPU dobierane do typu obciążenia: inferencja, embedding, reranking, preprocessing lub zadania asynchroniczne.
RAM, VRAM i magazyn danych muszą uwzględniać model, kontekst, cache, indeksy oraz dane robocze.
Przepustowość, opóźnienie, segmentacja oraz komunikacja z systemami źródłowymi i docelowymi.
Deployment, monitoring, aktualizacje, backup, logi i procedury odtwarzania są częścią infrastruktury, nie dodatkiem po wdrożeniu.
Określ liczbę żądań, rozmiar wejścia, oczekiwany czas odpowiedzi i pracę batchową.
Policz wymagania całego przepływu, nie tylko głównego modelu: retrieval, embedding, reranking, cache i preprocessing.
Zostaw rezerwę na skoki obciążenia, aktualizacje i wzrost danych.
Sprawdź, kto utrzymuje środowisko i jak system zachowuje się podczas awarii.
| Metryka | Po co ją mierzyć |
|---|---|
| Latency | Czy użytkownik lub proces otrzymuje wynik wystarczająco szybko. |
| Throughput | Ile pracy system może wykonać w jednostce czasu. |
| Utilization | Czy zasoby są realnie używane czy tylko zarezerwowane. |
| Error rate | Czy problemy wynikają z modelu, pamięci, integracji czy infrastruktury. |
| Availability | Czy system spełnia wymagany poziom dostępności. |
Nie ma uniwersalnej odpowiedzi. Lokalne środowisko może zwiększyć kontrolę i ograniczyć zależność od zewnętrznych usług. Chmura może ułatwić skalowanie i dostęp do większych zasobów. Architektura hybrydowa pozwala rozdzielić komponenty według klasy danych i charakteru obciążenia.
Wymagania infrastruktury powinny wynikać z realnego testu reprezentatywnego obciążenia oraz zdefiniowanych metryk jakości i wydajności.