przeszeregowanie wyników

Drugi etap wyszukiwania, w którym model ocenia parę pytanie–dokument widząc oba teksty naraz, zamiast porównywać osobno policzone wektory. Dokładniejszy i wolniejszy, więc stosowany do krótkiej listy kandydatów z etapu pierwszego. Radzi sobie z negacją i niuansami, na których wyszukiwanie wektorowe zawodzi.

W Polsce nazywane też:

przeszeregowanie wynikówrerankerdwuetapowe wyszukiwanie

Wyszukiwanie wektorowe jest szybkie i przybliżone. Reranking bierze jego wynik i pyta dokładniej — a różnica w jakości bywa większa niż przy zmianie modelu embeddingowego.

Dlaczego dwa etapy

Model embeddingowy koduje pytanie i dokument osobno, a potem porównuje odległość wektorów. Jest szybki, bo wektory dokumentów da się policzyć raz i przechowywać. Płaci się za to precyzją: reprezentacja dokumentu powstała, zanim padło pytanie, więc nie może uwzględniać jego niuansów.

Reranker działa inaczej. Dostaje parę pytanie–dokument naraz i ocenia dopasowanie, widząc oba teksty jednocześnie. To znacznie dokładniejsze i znacznie wolniejsze — dlatego nie da się tego zrobić dla całej bazy.

Jak wygląda to w praktyce

Etap pierwszy pobiera z bazy kilkadziesiąt kandydatów metodą szybką. Etap drugi przepuszcza tę krótką listę przez reranker i zwraca kilka najlepszych. Do kontekstu modelu trafia dopiero wynik drugiego etapu.

Co to naprawia

Reranking radzi sobie z problemami, o które rozbija się samo wyszukiwanie wektorowe: rozróżnia zdanie od jego zaprzeczenia, wyłapuje niuanse, których uśredniona reprezentacja akapitu nie zachowała, i lepiej ocenia, czy dokument faktycznie odpowiada na pytanie, a nie tylko dotyczy tego samego tematu.

Koszt

Dodatkowe opóźnienie i dodatkowe wywołanie modelu na każde zapytanie. W zamian można pobierać mniej fragmentów do kontekstu, bo są trafniejsze — co przy agencie wykonującym wiele kroków bywa oszczędnością netto.

wyszukiwanie hybrydowePołączenie wyszukiwania wektorowego z pełnotekstowym, z wynikami łączonymi w jeden ranking. Wyszukiwanie po tekście ratuje przypadki, w których embeddingi zawodzą: identyfikatory, kwoty, daty, rzadkie nazwy własne i terminy branżowe. Standard przy bazach z dokumentacją, danymi produktowymi i umowami.Wektorowa baza danychBaza danych zoptymalizowana pod przechowywanie i przeszukiwanie embeddingów — umożliwiająca szybkie wyszukiwanie semantyczne "znajdź K najbliższych wektorów do tego zapytania". Fundament infrastruktury RAG dla agentów AI.Fragmentacja dokumentówProces dzielenia długich dokumentów na mniejsze fragmenty przed embeddingiem — kluczowy krok w pipeline RAG który bezpośrednio wpływa na jakość wyszukiwania semantycznego. Zbyt małe chunki tracą kontekst, zbyt duże gubią szczegóły. Właściwy chunking to jeden z najważniejszych czynników jakości RAG.Osadzenie wektoroweNumeryczna reprezentacja tekstu w wielowymiarowej przestrzeni wektorowej, gdzie podobne znaczeniowo obiekty mają bliskie wektory — fundament wyszukiwania semantycznego i RAG. Termin obejmuje dwie różne rzeczy: wiersz macierzy embeddingów wskazywany numerem tokenu wewnątrz modelu językowego oraz wektor całego tekstu zwracany przez osobny model embeddingowy.Generowanie wspomagane wyszukiwaniemArchitektura systemu AI łącząca model językowy z zewnętrzną bazą wiedzy — model otrzymuje w czasie rzeczywistym fragmenty dokumentów odnalezione przez wyszukiwanie semantyczne i generuje odpowiedź na podstawie aktualnej, specyficznej dla kontekstu wiedzy zamiast polegać wyłącznie na danych treningowych.