Du kannst Filter kombinieren. Übrig bleiben nur Modelle, die alle Bedingungen erfüllen.
Empfohlene Ausgangspunkte
Drei Optionen für unterschiedliche Aufgaben. Das ist keine Rangliste vom besten zum schlechtesten Modell.
Claude Fable 5.1
Empfehlung
Anthropic
Zusammenfassung
Für Programmierung, gestützt auf geprüfte Daten.
Claude Fable 5.1 erreicht laut Quellen IQ 53.4 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.
Für Stapelverarbeitung, gestützt auf geprüfte Daten.
DeepSeek V4.1 Flash erreicht laut Quellen IQ 39.5 und Eingabe $0.3/M. Erwäge es für Stapelverarbeitung, schnelle Antworten; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.
+Geeignet fürStapelverarbeitung · schnelle Antworten · eigener Betrieb
GLM-5.3 erreicht laut Quellen IQ 44.8 und Eingabe $1.4/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für anspruchsvolle Agenten, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.
+Geeignet füreigener Betrieb · regulierte Umgebungen · Stapelverarbeitung
Ein knapper Überblick. Ausführliche Zahlen, Quellen und Erklärungen stehen auf der Detailseite jedes Modells.
Kein Modell passt zu dieser Kombination. Versuche es mit weniger Filtern.
ModellZusammenfassungGeeignet / ungeeignetDaten
Claude Fable 5.1
Anthropic
Zusammenfassung
Für Programmierung, gestützt auf geprüfte Daten.
Claude Fable 5.1 erreicht laut Quellen IQ 53.4 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.
GPT-6 Astra erreicht laut Quellen IQ 52.7 und Eingabe $10/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, eigener Betrieb solltest du es vor dem Einsatz erneut testen.
+Geeignet fürProgrammierung · KI-Agenten · Bilder und multimodale Inhalte
−Nicht geeignet fürkostengünstige Massenverarbeitung · eigener Betrieb · strenge Antwortzeitvorgaben
Claude Opus 5.5 erreicht laut Quellen IQ 51.2 und Eingabe $4/M. Erwäge es für Programmierung, KI-Agenten; für kostengünstige Massenverarbeitung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.
GPT-5.6 Sol erreicht laut Quellen IQ 47 und Eingabe $4/M. Erwäge es für Programmierung, KI-Agenten; für eigener Betrieb, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.
Grok 4.7 erreicht laut Quellen IQ 46.3 und Eingabe $2/M. Erwäge es für Programmierung, schnelle Antworten; für eigener Betrieb, regulierte Umgebungen solltest du es vor dem Einsatz erneut testen.
Für mehrsprachige Inhalte, gestützt auf geprüfte Daten.
Qwen3.8 Max erreicht laut Quellen IQ 45.4 und Eingabe $2/M. Erwäge es für mehrsprachige Inhalte, Programmierung; für eigener Betrieb, anspruchsvolle Agenten solltest du es vor dem Einsatz erneut testen.
GLM-5.3 erreicht laut Quellen IQ 44.8 und Eingabe $1.4/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für anspruchsvolle Agenten, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.
+Geeignet füreigener Betrieb · regulierte Umgebungen · Stapelverarbeitung
Für Stapelverarbeitung, gestützt auf geprüfte Daten.
DeepSeek V4.1 Flash erreicht laut Quellen IQ 39.5 und Eingabe $0.3/M. Erwäge es für Stapelverarbeitung, schnelle Antworten; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.
+Geeignet fürStapelverarbeitung · schnelle Antworten · eigener Betrieb
Für Stapelverarbeitung, gestützt auf geprüfte Daten.
Gemini 3.6 Flash erreicht laut Quellen IQ 34 und Eingabe $0.75/M. Erwäge es für Stapelverarbeitung, Unternehmenswissen; für komplexe Entwicklung, strenge Antwortzeitvorgaben solltest du es vor dem Einsatz erneut testen.
Für Stapelverarbeitung, gestützt auf geprüfte Daten.
DeepSeek V4 Pro 0813 erreicht laut Quellen IQ 36 und Eingabe $1.32/M. Erwäge es für Stapelverarbeitung, Programmierung; für Unternehmenskontrollen und Audits, anspruchsvolle Agenten solltest du es vor dem Einsatz erneut testen.
+Geeignet fürStapelverarbeitung · Programmierung · eigener Betrieb
−Nicht geeignet fürUnternehmenskontrollen und Audits · anspruchsvolle Agenten
Für Unternehmenswissen, gestützt auf geprüfte Daten.
Command A Plus erreicht laut Quellen IQ 13.1 und Eingabe $0/M. Erwäge es für Unternehmenswissen, Dokumentenextraktion; für schwierigste Programmieraufgaben, anspruchsvollstes logisches Schlussfolgern solltest du es vor dem Einsatz erneut testen.
Llama 4 Maverick erreicht laut Quellen IQ 10 und Eingabe $0.25/M. Erwäge es für eigener Betrieb, regulierte Umgebungen; für Komfort einer verwalteten API, anspruchsvollstes logisches Schlussfolgern solltest du es vor dem Einsatz erneut testen.
+Geeignet füreigener Betrieb · regulierte Umgebungen · Unternehmenswissen
−Nicht geeignet fürKomfort einer verwalteten API · anspruchsvollstes logisches Schlussfolgern
Kimi K3 erreicht laut Quellen IQ 43.6 und Eingabe $3/M. Erwäge es für Programmierung, Stapelverarbeitung; für Unternehmenskontrollen und Audits, zuverlässige Werkzeugnutzung solltest du es vor dem Einsatz erneut testen.
Claude Sonnet 5.5 erreicht laut Quellen IQ 40.8 und Eingabe $2/M. Erwäge es für Programmierung, KI-Agenten; für eigener Betrieb, kostengünstige Massenverarbeitung solltest du es vor dem Einsatz erneut testen.
Für Unternehmenswissen, gestützt auf geprüfte Daten.
Gemini 3.1 Pro Preview erreicht laut Quellen IQ 29.7 und Eingabe $2/M. Erwäge es für Unternehmenswissen, Bilder und multimodale Inhalte; für strenge Antwortzeitvorgaben, eigener Betrieb solltest du es vor dem Einsatz erneut testen.
+Geeignet fürUnternehmenswissen · Bilder und multimodale Inhalte · mehrsprachige Inhalte
−Nicht geeignet fürstrenge Antwortzeitvorgaben · eigener Betrieb
Für regulierte Umgebungen, gestützt auf geprüfte Daten.
Mistral Medium 3.5 erreicht laut Quellen IQ 14.2 und Eingabe $1.5/M. Erwäge es für regulierte Umgebungen, Unternehmenswissen; für anspruchsvollstes logisches Schlussfolgern, schwierigste Programmieraufgaben solltest du es vor dem Einsatz erneut testen.
Eine täglich aktualisierte Modellauswahl. Preise und Intelligence Index werden mit aktuellen Daten von Artificial Analysis abgeglichen; weitere Benchmarks nennen ihre eigenen Quellen. Eine geänderte Methodik kann die Bewertung beeinflussen, obwohl das Modell unverändert bleibt. Indexwerte verschiedener Zeitpunkte sind deshalb nicht immer direkt vergleichbar. Schlägt die Prüfung fehl, bleibt die letzte geprüfte Version mit ihrem ursprünglichen Datum bestehen.