Infrastruktura AI: CPU, GPU i środowisko uruchomieniowe
Sprzęt powinien wynikać z profilu obciążenia. Ten sam system AI może mieć inne wymagania dla interaktywnego API, przetwarzania batchowego, RAG albo lekkiej automatyzacji.
Nie wybiera się infrastruktury na podstawie samego hasła „AI”. Najpierw określa się model, pamięć, długość kontekstu, liczbę równoległych zadań, docelową latencję i charakter pracy. Dopiero wtedy można porównywać CPU, GPU, chmurę lub wariant hybrydowy.
Co naprawdę określa wymagania
| Czynnik | Wpływ |
|---|---|
| Rozmiar i typ modelu | Wpływa na pamięć i koszt pojedynczego uruchomienia. |
| Długość kontekstu | Zwiększa zużycie pamięci i czas przetwarzania. |
| Batch / równoległość | Zmienia wymagania przepustowości i pamięci. |
| Interaktywność | Proces użytkownika wymaga innej latencji niż zadanie nocne. |
| Profil danych | Pipeline może być ograniczony przez storage, sieć lub przygotowanie danych. |
CPU i GPU pełnią różne role
CPU pozostaje ważne dla logiki aplikacyjnej, przygotowania danych, kolejek, części embeddingów i wielu lekkich zadań. GPU jest przydatne przy obliczeniach równoległych i modelach, dla których przyspieszenie ma znaczenie. Nie oznacza to, że GPU automatycznie jest wąskim gardłem albo że każde zadanie powinno być na nim wykonywane.
Pamięć jest częścią decyzji
Liczy się nie tylko nominalna moc obliczeniowa, ale też pamięć dostępna dla modelu i kontekstu. Jeżeli model nie mieści się w zakładanej konfiguracji, system może wymagać innego wariantu modelu, innego podziału pracy lub innej architektury.
Wąskie gardło może być poza compute
Co mierzyć podczas testu
- Latencję pojedynczego zadania.
- Przepustowość przy docelowej równoległości.
- Zużycie pamięci i zachowanie przy dłuższym kontekście.
- Stabilność podczas dłuższego obciążenia.
- Czas oczekiwania w kolejce i błędy całego pipeline'u.
- Koszt utrzymania środowiska w realnym profilu pracy.
Benchmark wymaga kontekstu
Liczba bez opisu modelu, konfiguracji, danych wejściowych i metody testu nie pozwala porównać środowisk. Wynik powinien być powtarzalny i przypisany do konkretnego scenariusza — interaktywnego, batchowego albo innego jasno opisanego obciążenia.
Ta strona opisuje kryteria architektoniczne. Nie publikuje prywatnej konfiguracji sprzętowej ani nie przedstawia nieudokumentowanych benchmarków jako oficjalnego wyniku produkcyjnego.
Powiązane materiały
Najpierw profil obciążenia
Model, dane, latencja i równoległość są punktem wyjścia do decyzji o środowisku.