Welche KI ist die beste? Alle Modelle im Vergleich.
20 aktuelle KI-Modelle, verglichen nach 6 anerkannten Benchmarks und realen Kosten. Sortierbar, filterbar, kein Marketing, nur Daten.
Von Chatbot Arena Elo (menschliche Bewertung) über GPQA (Expertenwissen) bis Terminal-Bench (agentisches Programmieren), plus Preise pro Million Tokens für einen ehrlichen Kosten-Vergleich.
20
Modelle
6
Benchmarks
12
Anbieter
5
Quellen
LLM Ranking, Alle Modelle
Klicke auf eine Spaltenüberschrift zum Sortieren. Filtere nach Use Case, Anbieter oder Open-Source-Status.
Use Case
Anbieter
20 von 20 Modellen
| Claude Fable 5 | Anthropic | 1,507 | 60.0 | 93.0 | 85.0 | 53.0 | 60.0 | $10 | $50 | 1M |
| Muse Spark 1.1 | Meta | 1,495 | 51.0 | 90.0 | 78.0 | 45.0 | 58.0 | $1.3 | $4.3 | 1.1M |
| Gemini 3.1 Pro | 1,486 | 46.0 | 94.0 | 74.0 | 45.0 | 59.0 | $2 | $12 | 1M | |
| Kimi K3 | Moonshot | 1,486 | 57.0 | 94.0 | 85.0 | 44.0 | 59.0 | $3 | $15 | 1.1M |
| GPT-5.6 Sol | OpenAI | 1,485 | 56.0 | 93.0 | 87.0 | 44.0 | 57.0 | $5 | $30 | 1M |
| Gemini 3.6 Flash | 1,485 | 50.0 | 93.0 | 78.0 | 38.0 | 53.0 | $1.5 | $7.5 | 1M | |
| Gemini 3.5 Flash | 1,476 | 50.0 | 92.0 | 79.0 | 41.0 | 53.0 | $1.5 | $9 | 1M | |
| Qwen3.7 Max | Alibaba | 1,475 | 46.0 | 92.0 | 75.0 | 38.0 | 49.0 | $2.5 | $7.5 | 1M |
| GLM-5.2Open | Z.AI | 1,469 | 51.0 | 89.0 | 78.0 | 40.0 | 50.0 | $1.4 | $4.4 | 1M |
| Grok 4.5 | xAI | 1,468 | 54.0 | 93.0 | 82.0 | 40.0 | 54.0 | $2 | $6 | 500K |
| ERNIE 5.1 | Baidu | 1,468 | – | – | – | – | – | – | – | – |
| Claude Sonnet 5 | Anthropic | 1,461 | 53.0 | 91.0 | 81.0 | 40.0 | 54.0 | $2 | $10 | 1M |
| DeepSeek V4 ProOpen | DeepSeek | 1,457 | 44.0 | 89.0 | 64.0 | 36.0 | 50.0 | $0.43 | $0.87 | 1M |
| MiniMax-M3Open | MiniMax | 1,444 | 44.0 | 93.0 | 65.0 | 37.0 | 45.0 | $0.30 | $1.2 | 1M |
| Mistral Medium 3.5Open | Mistral | 1,427 | 30.0 | 75.0 | 51.0 | 13.0 | 40.0 | $1.5 | $7.5 | 256K |
| Mistral Large 3Open | Mistral | 1,415 | 16.0 | 68.0 | 12.0 | 4.0 | 36.0 | $0.50 | $1.5 | 256K |
| Claude Haiku 4.5 | Anthropic | 1,412 | 30.0 | 67.0 | 44.0 | 10.0 | 43.0 | $1 | $5 | 200K |
| Claude Opus 5 | Anthropic | – | 59.0 | 94.0 | 88.0 | 51.0 | 54.0 | $5 | $25 | 1M |
| GPT-5.6 Terra | OpenAI | – | 49.0 | 90.0 | 76.0 | 37.0 | 50.0 | $2.5 | $15 | 1M |
| GPT-5.6 Luna | OpenAI | – | 46.0 | 89.0 | 70.0 | 32.0 | 51.0 | $1 | $6 | 1M |
Claude Fable 5
Anthropic
1,507
Elo
AA-Index
60.0
GPQA
93.0
Terminal
85.0
HLE
53.0
SciCode
60.0
Muse Spark 1.1
Meta
1,495
Elo
AA-Index
51.0
GPQA
90.0
Terminal
78.0
HLE
45.0
SciCode
58.0
Gemini 3.1 Pro
1,486
Elo
AA-Index
46.0
GPQA
94.0
Terminal
74.0
HLE
45.0
SciCode
59.0
Kimi K3
Moonshot
1,486
Elo
AA-Index
57.0
GPQA
94.0
Terminal
85.0
HLE
44.0
SciCode
59.0
GPT-5.6 Sol
OpenAI
1,485
Elo
AA-Index
56.0
GPQA
93.0
Terminal
87.0
HLE
44.0
SciCode
57.0
Gemini 3.6 Flash
1,485
Elo
AA-Index
50.0
GPQA
93.0
Terminal
78.0
HLE
38.0
SciCode
53.0
Gemini 3.5 Flash
1,476
Elo
AA-Index
50.0
GPQA
92.0
Terminal
79.0
HLE
41.0
SciCode
53.0
Qwen3.7 Max
Alibaba
1,475
Elo
AA-Index
46.0
GPQA
92.0
Terminal
75.0
HLE
38.0
SciCode
49.0
GLM-5.2
Z.AI
1,469
Elo
AA-Index
51.0
GPQA
89.0
Terminal
78.0
HLE
40.0
SciCode
50.0
Grok 4.5
xAI
1,468
Elo
AA-Index
54.0
GPQA
93.0
Terminal
82.0
HLE
40.0
SciCode
54.0
ERNIE 5.1
Baidu
1,468
Elo
AA-Index
–
GPQA
–
Terminal
–
HLE
–
SciCode
–
Claude Sonnet 5
Anthropic
1,461
Elo
AA-Index
53.0
GPQA
91.0
Terminal
81.0
HLE
40.0
SciCode
54.0
DeepSeek V4 Pro
DeepSeek
1,457
Elo
AA-Index
44.0
GPQA
89.0
Terminal
64.0
HLE
36.0
SciCode
50.0
MiniMax-M3
MiniMax
1,444
Elo
AA-Index
44.0
GPQA
93.0
Terminal
65.0
HLE
37.0
SciCode
45.0
Mistral Medium 3.5
Mistral
1,427
Elo
AA-Index
30.0
GPQA
75.0
Terminal
51.0
HLE
13.0
SciCode
40.0
Mistral Large 3
Mistral
1,415
Elo
AA-Index
16.0
GPQA
68.0
Terminal
12.0
HLE
4.0
SciCode
36.0
Claude Haiku 4.5
Anthropic
1,412
Elo
AA-Index
30.0
GPQA
67.0
Terminal
44.0
HLE
10.0
SciCode
43.0
Claude Opus 5
Anthropic
Elo
AA-Index
59.0
GPQA
94.0
Terminal
88.0
HLE
51.0
SciCode
54.0
GPT-5.6 Terra
OpenAI
Elo
AA-Index
49.0
GPQA
90.0
Terminal
76.0
HLE
37.0
SciCode
50.0
GPT-5.6 Luna
OpenAI
Elo
AA-Index
46.0
GPQA
89.0
Terminal
70.0
HLE
32.0
SciCode
51.0
Was messen diese Benchmarks?
Arena Elo
↑ Höher = besserCrowdsourced Blind-Voting: Echte Nutzer vergleichen zwei anonyme Modelle und wählen das bessere. Gilt als realistischster Qualitätsindikator, weil er menschliche Präferenz direkt misst. Die Skala wurde Anfang 2026 rekalibriert, Werte sind nicht mit älteren Snapshots vergleichbar.
Quelle: Arena (ehem. LMArena / LMSYS) →AA-Index
↑ Höher = besserSammelwert aus neun Einzeltests, darunter GPQA Diamond, Humanity's Last Exam, Terminal-Bench und SciCode. Artificial Analysis misst alle Tests selbst und unter gleichen Bedingungen, deshalb sind die Werte untereinander gut vergleichbar. Skala 0 bis 100, die Spitze liegt aktuell bei etwa 60.
Quelle: Artificial Analysis →GPQA
↑ Höher = besserFragen auf Doktoranden-Niveau in Physik, Chemie und Biologie. Fachexperten erreichen nur rund 65 Prozent. Die Spitzenmodelle liegen inzwischen bei über 90 Prozent, der Benchmark nähert sich damit seiner Sättigung.
Quelle: Rein et al., NYU, erhoben von Artificial Analysis →Terminal-Bench
↑ Höher = besserAgentische Aufgaben in einer echten Shell: Das Modell muss Kommandos absetzen, Ausgaben lesen und sich zum Ziel vorarbeiten. Hat SWE-bench als Referenz für praktische Coding-Fähigkeit weitgehend abgelöst, weil er den kompletten Werkzeugeinsatz prüft statt nur den Patch.
Quelle: Stanford / Laude Institute, erhoben von Artificial Analysis →HLE
↑ Höher = besserRund 2.500 Expertenfragen aus über hundert Fachgebieten, bewusst so gebaut, dass Suchmaschinen und Auswendiglernen nicht helfen. Bewusst weit von der Sättigung entfernt: Selbst die stärksten Modelle liegen erst bei etwa der Hälfte.
Quelle: Center for AI Safety / Scale AI, erhoben von Artificial Analysis →SciCode
↑ Höher = besserProgrammieraufgaben aus der echten Forschung: Physik, Biologie und Materialwissenschaft. Das Modell muss wissenschaftliche Verfahren in lauffähigen Code übersetzen, nicht nur Syntax beherrschen.
Quelle: Tian et al., erhoben von Artificial Analysis →Kosten-Effizienz: Qualität pro Dollar
Der reine Benchmark-Score sagt wenig über den Praxiswert, wenn ein Modell 10× mehr kostet. Deshalb lohnt sich der Blick auf das Verhältnis von Qualität zu Kosten.
Tipp: Sortiere die Tabelle oben nach „$/1M Out“ (Kosten pro Million Output-Tokens) und vergleiche mit dem Arena-Elo-Score. Modelle wie DeepSeek V4 Pro, MiniMax-M3 oder GLM-5.2 bieten starke Leistung zu einem Bruchteil der Kosten der Flaggschiff-Modelle.
Für die meisten Business-Anwendungen ist nicht das beste Modell die richtige Wahl, sondern das effizienteste, das die eigene Qualitätsschwelle erreicht.
DeepSeek V4 Pro
DeepSeek
MiniMax-M3
MiniMax
Mistral Large 3
Mistral
Methodik & Quellen
Anerkannte Benchmarks
Chatbot Arena (Blind-Voting) sowie der Artificial Analysis Intelligence Index mit GPQA Diamond, Terminal-Bench, Humanity's Last Exam und SciCode. MMLU-Pro, SWE-bench und AIME sind im Juli 2026 entfallen, weil sie in der aktuellen Index-Version nicht mehr erhoben werden. Fehlende Werte bleiben leer statt geschätzt.
Aktuelle Preise
Offizielle API-Preise, erhoben von Artificial Analysis. Preise können sich ändern, Stand ist das angezeigte Aktualisierungsdatum.
Redaktionelle Bewertung
Use-Case-Ratings (1–5 Sterne) sind aus den Benchmarks abgeleitet: Chat aus dem Arena-Elo, Coding aus Terminal-Bench, Reasoning aus dem AA-Index, Lange Dokumente aus dem Kontextfenster. Benchmark-Scores sind gemessen, die Sterne eine Einordnung.
Alle Quellen
Eine Einschränkung, die man kennen sollte: Reasoning-Modelle laufen in mehreren Effort-Stufen, und die beiden Quellen testen nicht immer dieselbe. Arena-Elo und AA-Index einer Zeile können daher aus unterschiedlichen Konfigurationen desselben Modells stammen. Modelle, die nur eine der beiden Quellen führt, haben in der anderen Spalte einen Strich.
Letzte Aktualisierung: 25. Juli 2026 · Daten fehlen oder veraltet? Melden →