Wyszukiwanie semantyczne
Odnajdywanie treści podobnej znaczeniowo mimo różnego słownictwa.
Embedding reprezentuje tekst lub inne dane w postaci wektora, dzięki czemu system może szukać podobieństwa znaczeniowego, a nie tylko identycznych słów. To część retrievalu, nie gotowy system wiedzy.
Odnajdywanie treści podobnej znaczeniowo mimo różnego słownictwa.
Wstępny wybór fragmentów, które mogą dostarczyć kontekst modelowi generującemu.
Wspieranie deduplikacji, klastrowania lub znajdowania podobnych rekordów.
Porównanie nowego elementu z reprezentacjami znanych kategorii lub przykładów.
Dokumenty i zapytania muszą być reprezentowane w zgodny sposób. Zmiana modelu embeddingowego zwykle oznacza potrzebę ponownego przeliczenia indeksu, ponieważ wektory z różnych przestrzeni nie powinny być porównywane jak jedna spójna reprezentacja.
W produkcyjnym systemie podobieństwo semantyczne często trzeba połączyć z filtrami: użytkownik, tenant, typ dokumentu, wersja, data, język lub status. Bez metadanych retrieval może zwracać trafną znaczeniowo, ale nieuprawnioną albo nieaktualną treść.
| Problem | Skutek |
|---|---|
| Zbyt ogólny fragment | Wektor opisuje wiele tematów i retrieval traci precyzję. |
| Zbyt mały fragment | Wynik traci kontekst potrzebny do interpretacji. |
| Brak filtrów | System miesza wersje, typy lub zakresy uprawnień. |
| Stary indeks | Wyszukiwanie nie odzwierciedla aktualnych źródeł. |
| Ocena tylko „na oko” | Nie wiadomo, czy właściwe źródła rzeczywiście trafiają do TOP-k. |
Przygotuj pytania z oczekiwanymi źródłami i sprawdzaj, czy właściwy dokument lub fragment znajduje się wśród pierwszych wyników. Sam rozmiar wektora, marka modelu albo popularność bazy nie zastępują testu na rzeczywistych danych.