Lilith Lilith.
Redaktionelle Illustration: Hy4: Tencent schließt still und leise zur Spitze der offenen Modelle auf
Illustration von Lilith · redaktioneller Remix

Tencent betritt den Ring mit einem 770B Textmodell

Das chinesische Unternehmen Tencent hat Hy4 Preview veröffentlicht, ein neues Textmodell mit offenen Gewichten. Es stellt einen gewaltigen Sprung dar: 770 Milliarden Gesamtparameter (49 Milliarden aktiv in einer Mixture-of-Experts-Architektur) und ein Kontextfenster von 1 Million Token. Auf Hugging Face belegt es 1,56 TB. Die Vorgängerversion vom Juli, Hy3, hatte „nur“ 295 Milliarden Parameter und einen Kontext von 256K.

Ein interessantes Detail, das Simon Willison in der Datei chat_template.jinja aufgefallen ist, deutet auf eine integrierte Chain-of-Thought-Fähigkeit hin: Das Modell erwartet explizit eine Einstellung reasoning_effort auf entweder high (Standard) oder no_think.

Ein weiteres Schwergewicht für lokale Entwickler

Obwohl das Modell blind ist (keine Vision), platziert es seine Kapazität an der absoluten Spitze der aktuellen Open-Weight-Modelle. Für Teams, die auf offenen Modellen mit der erforderlichen Hardware aufbauen, bietet es eine weitere starke Alternative zu Llama 3 oder Modellen von Mistral und Qwen.

Die integrierte, nativ unterstützte Argumentationsschicht zeigt auch, dass das „Denken“ vor dem Antworten zu einem Standardmerkmal der größten Modelle wird und nicht nur die Domäne von OpenAI und seinem O1 ist.

Teure Inferenz und verkürztes Englisch

Trotz der MoE-Architektur sind 1,56 TB an Daten zum Herunterladen ein riesiges Hindernis. Für die meisten lokalen Hacker wird das Modell nur über API oder spezialisierte Anbieter wie OpenRouter zugänglich bleiben.

Ein interessantes Ergebnis aus Tests ist, dass die verborgene Argumentationsspur Gedanken in leicht verkürztem, ungrammatischem Englisch generiert („Better maybe no.“). Dies ist wahrscheinlich das Ergebnis einer Optimierung für die Token-Effizienz. Das Modell benötigt in seiner Argumentation vor der Ausgabe keine perfekte Grammatik.

Wie sich das Modell in produktiven RAG-Systemen behauptet

Ob das Modell Anklang findet, wird von seiner tatsächlichen Fähigkeit abhängen, den 1-Millionen-Kontext ohne Halluzinationen zu nutzen. Erwarten Sie in den kommenden Tagen eine massive Welle von unabhängigen Needle In A Haystack-Benchmarks und Stresstests, die zeigen werden, ob es sich lohnt, die entsprechende Hardware dafür bereitzustellen.

Liliths Urteil

Tencents massives Textmodell beweist, dass native Argumentation zur Standardschicht für jeden wird, der in der obersten Liga mitspielen möchte.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗