Lilith Lilith.
Ilustracja redakcyjna: Hy4: Tencent po cichu dogania czołówkę otwartych modeli
Ilustracja Lilith · remiks redakcyjny

Tencent wchodzi na ring z modelem tekstowym 770B

Chińska firma Tencent wydała Hy4 Preview, nowy model tekstowy o otwartych wagach. Stanowi on ogromny skok: 770 miliardów całkowitych parametrów (49 miliardów aktywnych w architekturze Mixture-of-Experts) i okno kontekstowe o wielkości 1 miliona tokenów. Na platformie Hugging Face zajmuje 1,56 TB. Poprzednia lipcowa wersja, Hy3, miała „tylko” 295 miliardów parametrów i kontekst 256K.

Ciekawy szczegół zauważony przez Simona Willisona w pliku chat_template.jinja wskazuje na wbudowaną zdolność chain-of-thought: model jawnie oczekuje ustawienia reasoning_effort na wartość high (domyślną) lub no_think.

Kolejny zawodnik wagi ciężkiej dla lokalnych programistów

Choć model jest ślepy (brak wizji), jego pojemność stawia go w ścisłej czołówce obecnych modeli o otwartych wagach. Dla zespołów budujących na otwartych modelach i dysponujących odpowiednim sprzętem, to kolejna silna alternatywa dla Llama 3 lub modeli od Mistral i Qwen.

Wbudowana i natywnie obsługiwana warstwa wnioskowania pokazuje również, że „myślenie” przed odpowiedzią staje się standardowym wyposażeniem największych modeli, a nie tylko domeną OpenAI i jej modelu O1.

Drogi inferencja i skrócony angielski

Mimo architektury MoE, pobranie 1,56 TB danych to ogromna przeszkoda. Dla większości lokalnych hakerów model pozostanie dostępny tylko przez API lub wyspecjalizowanych dostawców, takich jak OpenRouter.

Ciekawym odkryciem z testów jest to, że ukryty ślad wnioskowania (reasoning trace) generuje myśli w lekko skróconym, niegramatycznym języku angielskim („Better maybe no.”). Prawdopodobnie jest to wynik optymalizacji pod kątem wydajności tokenów. Model nie potrzebuje idealnej gramatyki w swoich rozważaniach przed ostateczną odpowiedzią.

Jak model sprawdzi się w produkcyjnych systemach RAG

O tym, czy model zyska popularność, zadecyduje jego rzeczywista zdolność do wykorzystania milionowego kontekstu bez halucynacji. W nadchodzących dniach należy spodziewać się ogromnej fali niezależnych testów Needle In A Haystack i testów obciążeniowych, które pokażą, czy warto inwestować w odpowiedni sprzęt specjalnie dla niego.

Werdykt Lilith

Masywny model tekstowy Tencenta dowodzi, że natywne wnioskowanie staje się standardową warstwą dla każdego, kto chce grać w pierwszej lidze.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗