Lilith.
⌕

LLM-Wegweiser

Modellvergleich

Ein praktischer Überblick nach Einsatz, Preis und Grenzen. Setze Filter und öffne das Modell, das zur konkreten Aufgabe passt.

Aktualisiert 2026-10-08 Nächste Prüfung 2026-10-09 Änderungsverlauf →
Modelle filtern
16 Modelle
Einsatz
Budget
Kategorie

Du kannst Filter kombinieren. Übrig bleiben nur Modelle, die alle Bedingungen erfüllen.

Empfohlene Ausgangspunkte

Drei Optionen für unterschiedliche Aufgaben. Das ist keine Rangliste vom besten zum schlechtesten Modell.

Claude Fable 5.1

Empfehlung
Anthropic

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Claude Fable 5.1 erreicht laut Quellen IQ 53.4 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Unternehmenswissen
−Nicht geeignet fürkostengünstige Massenverarbeitung · strenge Antwortzeitvorgaben
53.4Intelligenzindex $10.0Eingabe / 1M $50.0Ausgabe / 1M

hohes Budget, wenn Fehler teuer sind · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben hohes Budget, wenn Fehler teuer sind ProgrammierungKI-Agenten
Modelldetails

DeepSeek V4.1 Flash

Empfehlung
DeepSeek

Zusammenfassung

Für Stapelverarbeitung, gestützt auf geprüfte Daten.

DeepSeek V4.1 Flash erreicht laut Quellen IQ 39.5 und Eingabe $0.3/M. Erwäge es für Stapelverarbeitung, schnelle Antworten; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürStapelverarbeitung · schnelle Antworten · eigener Betrieb
−Nicht geeignet füranspruchsvollstes logisches Schlussfolgern · schwierigste Programmieraufgaben
39.5Intelligenzindex $0.3Eingabe / 1M $1.2Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb Stapelverarbeitungschnelle Antworten
Modelldetails

GLM-5.3

Empfehlung
Z.AI/Zhipu

Zusammenfassung

Für eigener Betrieb, gestützt auf geprüfte Daten.

GLM-5.3 erreicht laut Quellen IQ 44.8 und Eingabe $1.4/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für anspruchsvolle Agenten, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet füreigener Betrieb · regulierte Umgebungen · Stapelverarbeitung
−Nicht geeignet füranspruchsvolle Agenten · schwierigste Programmieraufgaben
44.8Intelligenzindex $1.4Eingabe / 1M $4.4Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb eigener Betriebregulierte Umgebungen
Modelldetails

Modelle

Ein knapper Überblick. Ausführliche Zahlen, Quellen und Erklärungen stehen auf der Detailseite jedes Modells.

Claude Fable 5.1

Anthropic

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Claude Fable 5.1 erreicht laut Quellen IQ 53.4 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Unternehmenswissen
−Nicht geeignet fürkostengünstige Massenverarbeitung · strenge Antwortzeitvorgaben
53.4Intelligenzindex $10.0Eingabe / 1M $50.0Ausgabe / 1M

hohes Budget, wenn Fehler teuer sind · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben hohes Budget, wenn Fehler teuer sind ProgrammierungKI-Agenten
Modelldetails

GPT-6 Astra

OpenAI

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

GPT-6 Astra erreicht laut Quellen IQ 52.7 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, eigener Betrieb solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Bilder und multimodale Inhalte
−Nicht geeignet fürkostengünstige Massenverarbeitung · eigener Betrieb · strenge Antwortzeitvorgaben
52.7Intelligenzindex $10.0Eingabe / 1M $50.0Ausgabe / 1M

hohes Budget, wenn Fehler teuer sind · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben hohes Budget, wenn Fehler teuer sind ProgrammierungKI-Agenten
Modelldetails

Claude Opus 5.5

Anthropic

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Claude Opus 5.5 erreicht laut Quellen IQ 51.2 und Eingabe $4/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Unternehmenswissen
−Nicht geeignet fürkostengünstige Massenverarbeitung · strenge Antwortzeitvorgaben
51.2Intelligenzindex $4.0Eingabe / 1M $20.0Ausgabe / 1M

mittleres Budget · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben mittleres Budget ProgrammierungKI-Agenten
Modelldetails

GPT-5.6 Sol

OpenAI

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

GPT-5.6 Sol erreicht laut Quellen IQ 47 und Eingabe $4/M. Erwäge es für Programmierung, KI-Agenten; für eigener Betrieb, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Dokumentenextraktion
−Nicht geeignet füreigener Betrieb · strenge Antwortzeitvorgaben
47.0Intelligenzindex $4.0Eingabe / 1M $20.0Ausgabe / 1M

mittleres Budget · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben mittleres Budget ProgrammierungKI-Agenten
Modelldetails

Grok 4.7

xAI

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Grok 4.7 erreicht laut Quellen IQ 46.3 und Eingabe $2/M. Erwäge es für Programmierung, schnelle Antworten; für eigener Betrieb, regulierte Umgebungen solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · schnelle Antworten · Dokumentenextraktion
−Nicht geeignet füreigener Betrieb · regulierte Umgebungen
46.3Intelligenzindex $2.0Eingabe / 1M $6.0Ausgabe / 1M

mittleres Budget · anspruchsvollste Aufgaben · durch externe Daten verifiziert

anspruchsvollste Aufgaben mittleres Budget Programmierungschnelle Antworten
Modelldetails

Qwen3.8 Max

Alibaba

Zusammenfassung

Für mehrsprachige Inhalte, gestützt auf geprüfte Daten.

Qwen3.8 Max erreicht laut Quellen IQ 45.4 und Eingabe $2/M. Erwäge es für mehrsprachige Inhalte, Programmierung; für eigener Betrieb, anspruchsvolle Agenten solltest du es vor dem Einsatz erneut testen.

+Geeignet fürmehrsprachige Inhalte · Programmierung · Stapelverarbeitung
−Nicht geeignet füreigener Betrieb · anspruchsvolle Agenten
45.4Intelligenzindex $2.0Eingabe / 1M $6.0Ausgabe / 1M

mittleres Budget · Spezialist · durch externe Daten verifiziert

Spezialist mittleres Budget mehrsprachige InhalteProgrammierung
Modelldetails

GLM-5.3

Z.AI/Zhipu

Zusammenfassung

Für eigener Betrieb, gestützt auf geprüfte Daten.

GLM-5.3 erreicht laut Quellen IQ 44.8 und Eingabe $1.4/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für anspruchsvolle Agenten, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet füreigener Betrieb · regulierte Umgebungen · Stapelverarbeitung
−Nicht geeignet füranspruchsvolle Agenten · schwierigste Programmieraufgaben
44.8Intelligenzindex $1.4Eingabe / 1M $4.4Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb eigener Betriebregulierte Umgebungen
Modelldetails

DeepSeek V4.1 Flash

DeepSeek

Zusammenfassung

Für Stapelverarbeitung, gestützt auf geprüfte Daten.

DeepSeek V4.1 Flash erreicht laut Quellen IQ 39.5 und Eingabe $0.3/M. Erwäge es für Stapelverarbeitung, schnelle Antworten; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürStapelverarbeitung · schnelle Antworten · eigener Betrieb
−Nicht geeignet füranspruchsvollstes logisches Schlussfolgern · schwierigste Programmieraufgaben
39.5Intelligenzindex $0.3Eingabe / 1M $1.2Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb Stapelverarbeitungschnelle Antworten
Modelldetails

Gemini 3.6 Flash

Google

Zusammenfassung

Für Stapelverarbeitung, gestützt auf geprüfte Daten.

Gemini 3.6 Flash erreicht laut Quellen IQ 34 und Eingabe $0.75/M. Erwäge es für Stapelverarbeitung, Unternehmenswissen; für komplexe Entwicklung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürStapelverarbeitung · Unternehmenswissen · schnelle Antworten
−Nicht geeignet fürkomplexe Entwicklung · strenge Antwortzeitvorgaben
34.0Intelligenzindex $0.75Eingabe / 1M $3.75Ausgabe / 1M

günstig bei hohem Volumen · Spezialist · durch externe Daten verifiziert

Spezialist günstig bei hohem Volumen StapelverarbeitungUnternehmenswissen
Modelldetails

DeepSeek V4 Pro 0813

DeepSeek

Zusammenfassung

Für Stapelverarbeitung, gestützt auf geprüfte Daten.

DeepSeek V4 Pro 0813 erreicht laut Quellen IQ 36 und Eingabe $1.32/M. Erwäge es für Stapelverarbeitung, Programmierung; für Unternehmenskontrollen und Audits, anspruchsvolle Agenten solltest du es vor dem Einsatz erneut testen.

+Geeignet fürStapelverarbeitung · Programmierung · eigener Betrieb
−Nicht geeignet fürUnternehmenskontrollen und Audits · anspruchsvolle Agenten
36.0Intelligenzindex $1.32Eingabe / 1M $3.96Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb StapelverarbeitungProgrammierung
Modelldetails

Command A+

Cohere

Zusammenfassung

Für Unternehmenswissen, gestützt auf geprüfte Daten.

Command A Plus erreicht laut Quellen IQ 13.1 und Eingabe $0/M. Erwäge es für Unternehmenswissen, Dokumentenextraktion; für schwierigste Programmieraufgaben, anspruchsvollstes logisches Schlussfolgern solltest du es vor dem Einsatz erneut testen.

+Geeignet fürUnternehmenswissen · Dokumentenextraktion · regulierte Umgebungen
−Nicht geeignet fürschwierigste Programmieraufgaben · anspruchsvollstes logisches Schlussfolgern
13.1Intelligenzindex $0.0Eingabe / 1M $0.0Ausgabe / 1M

günstig bei hohem Volumen · Spezialist · durch externe Daten verifiziert

Spezialist günstig bei hohem Volumen UnternehmenswissenDokumentenextraktion
Modelldetails

Llama 4 Maverick

Meta

Zusammenfassung

Für eigener Betrieb, gestützt auf geprüfte Daten.

Llama 4 Maverick erreicht laut Quellen IQ 10 und Eingabe $0.25/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für Komfort einer verwalteten API, anspruchsvollstes logisches Schlussfolgern solltest du es vor dem Einsatz erneut testen.

+Geeignet füreigener Betrieb · regulierte Umgebungen · Unternehmenswissen
−Nicht geeignet fürKomfort einer verwalteten API · anspruchsvollstes logisches Schlussfolgern
10.0Intelligenzindex $0.25Eingabe / 1M $0.87Ausgabe / 1M

offenes Modell / eigener Betrieb · Spezialist · durch externe Daten verifiziert

Spezialist offenes Modell / eigener Betrieb eigener Betriebregulierte Umgebungen
Modelldetails

Kimi K3

Moonshot

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Kimi K3 erreicht laut Quellen IQ 43.6 und Eingabe $3/M. Erwäge es für Programmierung, Stapelverarbeitung; für Unternehmenskontrollen und Audits, zuverlässige Werkzeugnutzung solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · Stapelverarbeitung · Unternehmenswissen
−Nicht geeignet fürUnternehmenskontrollen und Audits · zuverlässige Werkzeugnutzung
43.6Intelligenzindex $3.0Eingabe / 1M $15.0Ausgabe / 1M

mittleres Budget · Spezialist · durch externe Daten verifiziert

Spezialist mittleres Budget ProgrammierungStapelverarbeitung
Modelldetails

Claude Sonnet 5.5

Anthropic

Zusammenfassung

Für Programmierung, gestützt auf geprüfte Daten.

Claude Sonnet 5.5 erreicht laut Quellen IQ 40.8 und Eingabe $2/M. Erwäge es für Programmierung, KI-Agenten; für eigener Betrieb, kostengünstige Massenverarbeitung solltest du es vor dem Einsatz erneut testen.

+Geeignet fürProgrammierung · KI-Agenten · Unternehmenswissen
−Nicht geeignet füreigener Betrieb · kostengünstige Massenverarbeitung
40.8Intelligenzindex $2.0Eingabe / 1M $10.0Ausgabe / 1M

mittleres Budget · Spezialist · durch externe Daten verifiziert

Spezialist mittleres Budget ProgrammierungKI-Agenten
Modelldetails

Gemini 3.1 Pro Preview

Google

Zusammenfassung

Für Unternehmenswissen, gestützt auf geprüfte Daten.

Gemini 3.1 Pro Preview erreicht laut Quellen IQ 29.7 und Eingabe $2/M. Erwäge es für Unternehmenswissen, Bilder und multimodale Inhalte; für strenge Antwortzeitvorgaben, eigener Betrieb solltest du es vor dem Einsatz erneut testen.

+Geeignet fürUnternehmenswissen · Bilder und multimodale Inhalte · mehrsprachige Inhalte
−Nicht geeignet fürstrenge Antwortzeitvorgaben · eigener Betrieb
29.7Intelligenzindex $2.0Eingabe / 1M $12.0Ausgabe / 1M

mittleres Budget · Spezialist · durch externe Daten verifiziert

Spezialist mittleres Budget UnternehmenswissenBilder und multimodale Inhalte
Modelldetails

Mistral Medium 3.5

Mistral AI

Zusammenfassung

Für regulierte Umgebungen, gestützt auf geprüfte Daten.

Mistral Medium 3.5 erreicht laut Quellen IQ 14.2 und Eingabe $1.5/M. Erwäge es für regulierte Umgebungen, Unternehmenswissen; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.

+Geeignet fürregulierte Umgebungen · Unternehmenswissen · Dokumentenextraktion
−Nicht geeignet füranspruchsvollstes logisches Schlussfolgern · schwierigste Programmieraufgaben
14.2Intelligenzindex $1.5Eingabe / 1M $7.5Ausgabe / 1M

mittleres Budget · Spezialist · durch externe Daten verifiziert

Spezialist mittleres Budget regulierte UmgebungenUnternehmenswissen
Modelldetails
Wie die Daten zusammengestellt werden

Eine täglich aktualisierte Modellauswahl. Preise und Intelligence Index werden mit aktuellen Daten von Artificial Analysis abgeglichen; weitere Benchmarks nennen ihre eigenen Quellen. Eine geänderte Methodik kann die Bewertung beeinflussen, obwohl das Modell unverändert bleibt. Indexwerte verschiedener Zeitpunkte sind deshalb nicht immer direkt vergleichbar. Schlägt die Prüfung fehl, bleibt die letzte geprüfte Version mit ihrem ursprünglichen Datum bestehen.