Jak oceniać modele LLM w zastosowaniach firmowych
Model powinien być oceniany na zadaniach odpowiadających rzeczywistemu procesowi. Rozmiar, popularność lub pojedyncza demonstracja nie wystarczają do wyboru komponentu produkcyjnego.
Zestaw testowy
Przygotuj reprezentatywne przypadki: typowe, trudne, niepełne i takie, w których poprawnym wynikiem jest odmowa lub eskalacja. Każdy przypadek powinien mieć oczekiwany rezultat albo jasną rubrykę oceny.
| Obszar | Co mierzyć |
|---|---|
| Jakość | Poprawność, kompletność, zgodność z instrukcją i błędy krytyczne. |
| Stabilność | Zachowanie na podobnych wejściach i po zmianach konfiguracji. |
| Kontekst | Czy model zachowuje istotne informacje przy dłuższym wejściu. |
| Wydajność | Czas odpowiedzi, przepustowość i zużycie zasobów. |
| Operacje | Koszt, dostępność, limity i możliwość monitorowania. |
Regresja po zmianie
Zmiana modelu, wersji runtime, promptu systemowego, parametrów lub kwantyzacji może poprawić jedną klasę zadań i pogorszyć inną. Dlatego po każdej istotnej zmianie należy powtórzyć ten sam zestaw testowy, zamiast porównywać pojedyncze przykłady.
Co unieważnia proste porównanie
Różne dane wejściowe, inne limity kontekstu, sprzęt, parametry generowania albo różne kryteria oceny. Jeśli kilka tych elementów zmienia się jednocześnie, nie można wiarygodnie przypisać całej różnicy samemu modelowi.
Źródła referencyjne
- NIST AI Risk Management Framework 1.0 — ramy zarządzania ryzykiem i oceny systemów AI.
- NIST AI 600-1: Generative AI Profile — ryzyka i działania specyficzne dla generatywnej AI.