PYTANIE // JAKOŚĆ I TESTY
Jak mierzyć jakość systemu AI?
Najpierw trzeba zdefiniować, co oznacza dobry wynik dla konkretnego procesu. Sama jakość modelu nie wystarcza, jeśli retrieval, integracja lub dalszy workflow zawodzą.
Zacznij od reprezentatywnych zadań
Zestaw testowy powinien zawierać przypadki typowe, trudne, brzegowe i błędne. Jeżeli test obejmuje tylko kilka dobrze dobranych promptów demonstracyjnych, wynik nie mówi wiele o produkcji.
Przykładowe kryteria
| Obszar | Przykład pomiaru |
|---|---|
| Poprawność | Czy odpowiedź lub klasyfikacja jest merytorycznie właściwa. |
| Kompletność | Czy wynik zawiera wszystkie wymagane elementy. |
| Błędy krytyczne | Jak często pojawia się błąd, którego proces nie może zaakceptować. |
| Źródła | Czy odpowiedź jest zgodna z materiałem źródłowym. |
| Stabilność | Czy podobne zadania dają wyniki mieszczące się w ustalonych kryteriach. |
| Operacje | Latencja, wyjątki, koszt i odsetek spraw przekazanych człowiekowi. |
RAG i automatyzację oceniaj warstwami
W RAG osobno mierz retrieval i generację. W automatyzacji osobno sprawdź jakość decyzji AI, poprawność reguł, integracje, retry i stan procesu. Dzięki temu wiadomo, gdzie naprawdę powstaje błąd.
Po każdej istotnej zmianie wykonaj regresję
Zmiana modelu, promptu, źródeł wiedzy, chunkingu lub API może wpłynąć na wcześniej poprawne przypadki. Ten sam zestaw testowy pozwala porównać wersje bez zgadywania.