TERVYXA SYSTEMS
PYTANIE // JAKOŚĆ I TESTY

Jak mierzyć jakość systemu AI?

Najpierw trzeba zdefiniować, co oznacza dobry wynik dla konkretnego procesu. Sama jakość modelu nie wystarcza, jeśli retrieval, integracja lub dalszy workflow zawodzą.

Zacznij od reprezentatywnych zadań

Zestaw testowy powinien zawierać przypadki typowe, trudne, brzegowe i błędne. Jeżeli test obejmuje tylko kilka dobrze dobranych promptów demonstracyjnych, wynik nie mówi wiele o produkcji.

Przykładowe kryteria

ObszarPrzykład pomiaru
PoprawnośćCzy odpowiedź lub klasyfikacja jest merytorycznie właściwa.
KompletnośćCzy wynik zawiera wszystkie wymagane elementy.
Błędy krytyczneJak często pojawia się błąd, którego proces nie może zaakceptować.
ŹródłaCzy odpowiedź jest zgodna z materiałem źródłowym.
StabilnośćCzy podobne zadania dają wyniki mieszczące się w ustalonych kryteriach.
OperacjeLatencja, wyjątki, koszt i odsetek spraw przekazanych człowiekowi.

RAG i automatyzację oceniaj warstwami

W RAG osobno mierz retrieval i generację. W automatyzacji osobno sprawdź jakość decyzji AI, poprawność reguł, integracje, retry i stan procesu. Dzięki temu wiadomo, gdzie naprawdę powstaje błąd.

Po każdej istotnej zmianie wykonaj regresję

Zmiana modelu, promptu, źródeł wiedzy, chunkingu lub API może wpłynąć na wcześniej poprawne przypadki. Ten sam zestaw testowy pozwala porównać wersje bez zgadywania.