OCENA RAG
Jak mierzyć jakość systemu RAG
RAG trzeba oceniać co najmniej na dwóch poziomach: czy system odzyskał właściwe źródło oraz czy model poprawnie wykorzystał przekazany kontekst.
Najpierw retrieval
Zbuduj zestaw pytań z przypisanymi dokumentami lub fragmentami, które powinny zostać znalezione. Mierz, czy właściwe źródło znalazło się w TOP-k oraz czy wyniki są uporządkowane użytecznie dla kolejnego etapu.
| Warstwa | Przykładowe kryterium |
|---|---|
| Retrieval | Czy właściwe źródło znalazło się wśród kandydatów. |
| Reranking | Czy najbardziej przydatny fragment został przesunięty wyżej. |
| Generacja | Czy odpowiedź jest zgodna z dostarczonym kontekstem. |
| Źródła | Czy użytkownik może zweryfikować materiał, na którym oparto odpowiedź. |
| Uprawnienia | Czy retrieval nie zwraca treści spoza dostępu użytkownika. |
Test braku odpowiedzi
Dodaj pytania, na które w źródłach nie ma wystarczającej informacji. Dobry system powinien rozpoznać brak podstaw do odpowiedzi zamiast płynnie uzupełniać brakujące fakty.
Regresja RAG
Zmiana chunkingu, embeddings, filtrów, rerankera, źródeł lub modelu generującego może zmienić wynik. Testy powinny więc obejmować cały pipeline i być powtarzane po każdej istotnej zmianie.
Źródła referencyjne
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020 — oryginalna publikacja opisująca RAG.
- OWASP LLM Prompt Injection Prevention Cheat Sheet — zagrożenia związane z niezaufaną treścią i połączonymi narzędziami.
- NIST AI 600-1: Generative AI Profile — zarządzanie ryzykiem generatywnej AI.