TERVYXA SYSTEMS
TECHNOLOGY // INFRASTRUCTURE

Infrastruktura AI powinna wynikać z obciążenia, nie z listy sprzętu.

CPU, GPU, pamięć, storage i sieć są tylko zasobami. Dobra architektura zaczyna się od wymagań: wielkości modeli, kontekstu, liczby użytkowników, opóźnienia, dostępności, prywatności i kosztu operacyjnego.

Warstwy infrastruktury

Compute

CPU i GPU dobierane do typu obciążenia: inferencja, embedding, reranking, preprocessing lub zadania asynchroniczne.

Pamięć i storage

RAM, VRAM i magazyn danych muszą uwzględniać model, kontekst, cache, indeksy oraz dane robocze.

Sieć i integracje

Przepustowość, opóźnienie, segmentacja oraz komunikacja z systemami źródłowymi i docelowymi.

Operacje

Deployment, monitoring, aktualizacje, backup, logi i procedury odtwarzania są częścią infrastruktury, nie dodatkiem po wdrożeniu.

Jak dobierać środowisko

1. Obciążenie

Określ liczbę żądań, rozmiar wejścia, oczekiwany czas odpowiedzi i pracę batchową.

2. Model i pipeline

Policz wymagania całego przepływu, nie tylko głównego modelu: retrieval, embedding, reranking, cache i preprocessing.

3. Margines

Zostaw rezerwę na skoki obciążenia, aktualizacje i wzrost danych.

4. Operacje

Sprawdź, kto utrzymuje środowisko i jak system zachowuje się podczas awarii.

Metryki ważniejsze niż sama specyfikacja

MetrykaPo co ją mierzyć
LatencyCzy użytkownik lub proces otrzymuje wynik wystarczająco szybko.
ThroughputIle pracy system może wykonać w jednostce czasu.
UtilizationCzy zasoby są realnie używane czy tylko zarezerwowane.
Error rateCzy problemy wynikają z modelu, pamięci, integracji czy infrastruktury.
AvailabilityCzy system spełnia wymagany poziom dostępności.

Lokalnie, w chmurze czy hybrydowo

Nie ma uniwersalnej odpowiedzi. Lokalne środowisko może zwiększyć kontrolę i ograniczyć zależność od zewnętrznych usług. Chmura może ułatwić skalowanie i dostęp do większych zasobów. Architektura hybrydowa pozwala rozdzielić komponenty według klasy danych i charakteru obciążenia.

Najpierw benchmark procesu, potem zakup sprzętu.

Wymagania infrastruktury powinny wynikać z realnego testu reprezentatywnego obciążenia oraz zdefiniowanych metryk jakości i wydajności.