Lilith Lilith.
Redaktionelle Illustration: Open-Weights-Modelle verlieren an Boden gegenüber der geschlossenen Spitze
Illustration von Lilith · redaktioneller Remix

Die Kluft zwischen der Community und den Laboren wird wieder größer

Wharton-Professor Ethan Mollick, einer der sorgfältigsten praktischen KI-Tester, hebt einen klaren Trend hervor: Open-Weights-Modelle hinken der absoluten Spitze stärker hinterher, als wir es gewohnt waren. Auch wenn neue offene Versionen in Benchmarks vielversprechend aussehen, erreichen sie im praktischen täglichen Einsatz einfach nicht das Niveau von Modellen wie Claude 3 Opus oder Google Gemini Advanced. Das Rennen, das letztes Jahr noch ausgeglichen schien, wird jetzt von den Brieftaschen der größten Labore gewonnen.

Für die lokale Entwicklung bedeutet dies Kompromisse

Diese Dynamik wirkt sich direkt auf Teams aus, die auf KI aufbauen und ihre Daten im Haus behalten müssen. Wenn die Open-Weights-Schicht (wie Llama 3 oder Qwen) realistischerweise nicht die Qualität der besten geschlossenen Modelle liefert, müssen Ingenieure Kompromisse eingehen: Entweder opfern sie Leistung und Logik, oder sie senden Daten über die API nach draußen. Die Erzählung, dass die Community OpenAI und Anthropic bald aus eigener Kraft einholen wird, bekommt in der Praxis einen schweren Schlag.

Benchmark-Ergebnisse täuschen enorm

Wenn man sich die Pressemitteilungen für neue offene Modelle ansieht, sehen die Zahlen oft mit GPT-4 vergleichbar aus. Aber Mollicks Beobachtung spiegelt das wider, was jeder weiß, der täglich mit KI arbeitet: Synthetische Tests haben sich vom tatsächlichen Nutzen abgekoppelt. Die Fähigkeit, einen langen Kontext ohne Aufmerksamkeitsverlust beizubehalten, Nuancen im Tonfall und Zuverlässigkeit bei der Ausführung komplexer Anweisungen sind genau die Eigenschaften, bei denen die massive Rechenleistung der kommerziellen Giganten immer noch dominiert.

Das Warten auf das nächste große Release von Meta wird entscheiden

Das Schlüsselereignis für das Ökosystem der offenen Modelle wird die Veröffentlichung einer wirklich massiven Version von Llama 3 (400B+ Parameter) von Meta sein. Dieser Schritt wird zeigen, ob die aktuelle Lücke nur eine vorübergehende Schwankung ist, die durch den Veröffentlichungszyklus verursacht wird, oder ob die Open-Source-Kurve abflacht und die absolute Spitze sich dauerhaft von jedem entfernt, der nicht Milliarden in die Infrastruktur investiert.

Liliths Urteil

Die Geschichte einer Community-Revolution ist schön, aber solange man nicht lokal etwas ausführen kann, das den Kontext wie Claude hält, spielt man einfach nur in der zweiten Liga.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗