2026-08-24 · ← News
Analyse von 500.000 Publikationen zeigt, dass chinesische Modelle zur Grundlage der Forschung werden
Das meiste, was wir über die Akzeptanz von Modellen wissen, stammt aus Benchmarks oder Marketing-Pressemitteilungen, nicht aus harten Daten. Nathan Lambert ließ Codex über eine halbe Million KI/ML-Arbeiten analysieren, die seit der Einführung von ChatGPT auf arXiv veröffentlicht wurden. Er suchte darin nach spezifischen Erwähnungen der Verwendung offener Modelle für die Forschungsarbeit.
Die Analyse offenbart eine deutliche Wende. Im Jahr 2024 erwähnten rund 30 % der Publikationen ein offenes amerikanisches Modell und nur 10 % ein chinesisches. Heute geben 40 % der Papiere einen offenen chinesischen LLM an, während die amerikanischen Modelle bei 25 bis 30 % verharren und nicht weiter wachsen.
Qwen wird zum globalen Standard für Forschungslabore
Die Daten zeigen eine starke Trägheit bei der Adaption. Forschung und Publikation einer Arbeit dauern Monate, sodass akademische Zitationen naturgemäß ein bis zwei Zyklen hinter den Modellveröffentlichungen zurückbleiben. Heute nennt ein Drittel aller Publikationen, die überhaupt einen LLM erwähnen, Qwen von Alibaba. Llama von Meta hingegen erreichte um April 2025 bei rund einem Drittel der Papiere seinen Höhepunkt, und seither ist sein Anteil rückläufig.
Die Rolle der geschlossenen kommerziellen Giganten ist ebenfalls interessant. Auch wenn offene Modelle viele eigene Forschungsbemühungen vorantreiben, halten OpenAI und seine Modelle insgesamt die höchste Erwähnungsrate von rund 37 %. Claude von Anthropic und Gemini von Google bewegen sich weit hinter Qwen, Llama und DeepSeek.
Zitationen zeigen nur das, was die Autoren auch zugeben
Der Aufstieg von DeepSeek nach der Veröffentlichung der Version R1 im Januar 2025 ist in den Daten als steiler Anstieg klar zu erkennen. Doch die arXiv-Daten erfassen weiterhin nur das, was Akademiker gewillt und in der Lage sind, in ihre Texte zu schreiben. Darüber hinaus beschränkt sich die Analyse auf die Computerwissenschaften, in denen das Zitieren von Architekturen gängige Praxis ist.
Außerhalb des maschinellen Lernens, in den Geisteswissenschaften und bei Enterprise-Einsätzen, werden die Marktanteile anders aussehen. Dort gibt es keinen Grund, sich um offene Gewichte und Lizenzen zu kümmern, denn der dominierende Faktor ist die API oder das Webinterface.
Die Open-Source-Einflussnahme in Echtzeit verfolgen
Die nächsten Generationen offener Modelle von beiden Seiten des Pazifiks werden bald zeigen, ob es den amerikanischen Akteuren gelingt, die Abwärtskurve des akademischen Einflusses umzukehren, oder ob Qwen die Standardinfrastruktur für die globale Wissenschaft bleibt. Entscheidend wird die Adoption neuer Versionen über die Kontinente hinweg sein. Die Daten von Lambert werden kontinuierlich auf dem Interconnects Open Model Dashboard aktualisiert.
Die Abhängigkeit von einer einzigen Plattform birgt akademische Risiken
Der offene Ansatz der chinesischen Labore subventioniert derzeit de facto die globale akademische Forschung. Solange dies andauert, stehen den Forschern leistungsstarke Werkzeuge kostenlos zur Verfügung, aber die strategische Abhängigkeit von Ressourcen außerhalb ihrer direkten Kontrolle könnte bei einer Änderung der Lizenzierung zu einem Problem werden.
Liliths Urteil
Bei einem knappen akademischen Budget liefert Amerika einem nicht mehr automatisch die besten offenen Schlüssel für die Forschung.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗