RAG dla firm i kontrolowanej wiedzy AI
RAG łączy wyszukiwanie informacji w zatwierdzonych źródłach z generowaniem odpowiedzi. Jakość zależy od całego pipeline'u: danych, uprawnień, retrievalu, kontekstu i sposobu walidacji odpowiedzi.
Pipeline RAG
| Warstwa | Rola | Ryzyko |
|---|---|---|
| Źródła | Dokumenty i dane dopuszczone do systemu. | Nieaktualne lub sprzeczne wersje. |
| Przygotowanie | Ekstrakcja tekstu, chunking i metadane. | Utrata kontekstu lub brak informacji potrzebnych do filtrów. |
| Embedding / indeks | Reprezentacja używana do wyszukiwania. | Niespójny indeks po zmianie modelu lub źródeł. |
| Retrieval | Wybór kandydatów dla zapytania. | Właściwy fragment nie trafia do kontekstu. |
| Reranking | Ponowna ocena najlepszych kandydatów. | Dodatkowa latencja bez realnej poprawy. |
| Generacja | Odpowiedź na podstawie dostarczonego materiału. | Model nadinterpretuje lub uzupełnia brakujące fakty. |
Uprawnienia muszą działać przed modelem
Retrieval powinien filtrować dokumenty zgodnie z dostępem użytkownika. Model nie może otrzymać kontekstu, którego użytkownik nie ma prawa zobaczyć, nawet jeśli aplikacja później próbuje ukryć część odpowiedzi.
System musi umieć nie odpowiedzieć
Jeśli źródła nie zawierają wystarczającej informacji, poprawnym wynikiem może być komunikat o braku podstaw do odpowiedzi. To ważniejsza cecha niż wymuszanie płynnej odpowiedzi dla każdego pytania.
Kiedy RAG ma sens
- Wiedza zmienia się i powinna być aktualizowana bez trenowania modelu.
- Odpowiedź powinna prowadzić do konkretnego źródła.
- Organizacja posiada dokumentację, procedury lub inne kontrolowane zbiory wiedzy.
- Uprawnienia do treści można odwzorować w warstwie wyszukiwania.
Kiedy RAG nie jest rozwiązaniem
Nie zastępuje obliczeń, reguł biznesowych, transakcji ani jednoznacznego systemu prawdy. W takich przypadkach model może interpretować wejście, ale wynik operacyjny powinien pozostać w deterministycznym systemie.
Utrzymanie
Trzeba obsługiwać dodawanie, aktualizację i usuwanie dokumentów, przebudowę indeksu, wersjonowanie konfiguracji oraz pytania, na które system nie znajduje wystarczającego kontekstu. Zmiana embeddings, chunkingu lub modelu wymaga testów regresji.
Źródła referencyjne
- Lewis et al., NeurIPS 2020 — publikacja wprowadzająca architekturę Retrieval-Augmented Generation.
- OWASP GenAI / Top 10 for LLM Applications — kategorie ryzyka aplikacji opartych na LLM.
- NIST AI 600-1: Generative AI Profile — ramy ryzyka dla generatywnej AI.