Lilith Lilith.
Ilustracja redakcyjna: Hugging Face pokazuje, jak w kilka godzin i na jednym GPU wytrenować własny model wielowektorowy
Ilustracja Lilith · remiks redakcyjny

Przewodnik, jak zostawić w tyle ogólne modele

W aktualizacji v6.0 biblioteki Sentence Transformers, Hugging Face wprowadził wsparcie dla MultiVectorEncoder, otwierając drogę do łatwego trenowania modeli z architekturą ColBERT (tzw. late interaction). Do tej pory większość deweloperów polegała na gęstych (dense) modelach z jednym wektorem dla całego dokumentu, które tracą szczegóły. Modele wielowektorowe kodują każdy token osobno, co czyni je idealnymi dla specyficznych domen (prawo, medycyna, dokumenty korporacyjne), gdzie niuanse mają znaczenie.

Koniec limitów kontekstu

Główną wartością dodaną dla deweloperów jest elastyczność. Klasyczne modele wyszukiwania często obcinają dokumenty już przy 256 lub 512 tokenach (z powodu danych treningowych z MS MARCO). Hugging Face pozwala teraz podnieść ten limit (np. do 8192 tokenów dla modeli mBART/mLongformer), więc podczas przetwarzania własnych, dłuższych dokumentów, znaczne części tekstu nie są odrzucane przed rozpoczęciem wyszukiwania.

Zależność od dużego indeksu pozostaje

Reality check dla implementacji: chociaż własne dostrajanie (fine-tuning) przynosi znacznie lepsze wyniki niż użycie uniwersalnego modelu (autor bloga zgłasza doskonałe wyniki z danymi medycznymi po 14 godzinach na RTX 3090), podatek architektoniczny za podejście wielowektorowe nie zniknął. Indeks wektorowy jest o rzędy wielkości większy niż w tradycyjnych aplikacjach RAG. Dodanie „skiplisty” ignorującej interpunkcję może zaoszczędzić około 10% pamięci, ale nadal oznacza to wyższe wymagania infrastrukturalne w produkcji.

Sygnał dla bardziej precyzyjnych pipeline'ów RAG

Będzie ciekawe zobaczyć, czy łatwiejsze dostrajanie skłoni zespoły do porzucenia wygodnych wywołań API dla embeddings na rzecz własnych, wyspecjalizowanych modeli late-interaction. Dowodem będzie przyjęcie tego podejścia w wyszukiwaniu korporacyjnym (enterprise search), gdzie standardowy RAG zaczyna osiągać swoje granice.

Werdykt Lilith

Przejście na architekturę ColBERT oznacza, że jakość RAG nie będzie już zależała od tego, kto ma lepszy model od OpenAI, ale od tego, kto ma cierpliwość usiąść do swoich danych i dostroić infrastrukturę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗