Welche KI ist die beste? Alle Modelle im Vergleich.
21 aktuelle KI-Modelle, verglichen nach 6 anerkannten Benchmarks und realen Kosten. Sortierbar, filterbar, kein Marketing, nur Daten.
Von Chatbot Arena Elo (menschliche Bewertung) über GPQA (Expertenwissen) bis Terminal-Bench (agentisches Programmieren), plus Preise pro Million Tokens für einen ehrlichen Kosten-Vergleich.
21
Modelle
6
Benchmarks
12
Anbieter
5
Quellen
LLM Ranking, Alle Modelle
Klicke auf eine Spaltenüberschrift zum Sortieren. Filtere nach Use Case, Anbieter oder Open-Source-Status.
Use Case
Anbieter
21 von 21 Modellen
| Claude Fable 5 | Anthropic | 1.508 | 62.0 | 93.0 | 85.0 | 55.0 | 60.0 | $10 | $50 | 1M |
| Muse Spark 1.2 | Meta | 1.499 | 57.0 | 90.0 | 80.0 | 45.0 | 56.0 | $1.3 | $4.3 | 1.0M |
| Claude Opus 5 | Anthropic | 1.492 | 61.0 | 94.0 | 88.0 | 53.0 | 54.0 | $5 | $25 | 1M |
| Gemini 3.7 Flash | 1.491 | 56.0 | 95.0 | 86.0 | 48.0 | 57.0 | $0.75 | $3.8 | 1M | |
| Kimi K3Open | Moonshot | 1.489 | 60.0 | 94.0 | 85.0 | 47.0 | 59.0 | $3 | $15 | 1.0M |
| Gemini 3.1 Pro | 1.487 | 48.0 | 94.0 | 74.0 | 47.0 | 59.0 | $2 | $12 | 1M | |
| GPT-5.6 Sol | OpenAI | 1.483 | 57.0 | 93.0 | 87.0 | 46.0 | 57.0 | $4 | $20 | 1M |
| GLM-5.3Open | Z.AI | 1.482 | 60.0 | 92.0 | 84.0 | 42.0 | 56.0 | $1.4 | $4.4 | 1M |
| Gemini 3.6 Flash | 1.480 | 52.0 | 93.0 | 78.0 | 41.0 | 53.0 | $0.75 | $3.8 | 1M | |
| Qwen3.8 Max | Alibaba | 1.479 | 58.0 | 93.0 | 81.0 | 43.0 | 53.0 | $2 | $6 | 1M |
| ERNIE 5.1 | Baidu | 1.468 | – | – | – | – | – | – | – | – |
| GPT-5.6 Terra | OpenAI | 1.466 | 50.0 | 90.0 | 76.0 | 39.0 | 50.0 | $2 | $12 | 1M |
| Claude Sonnet 5 | Anthropic | 1.462 | 55.0 | 91.0 | 81.0 | 41.0 | 54.0 | $2 | $10 | 1M |
| Grok 4.6 | xAI | 1.461 | 61.0 | 95.0 | 88.0 | 43.0 | 54.0 | $2 | $6 | 500K |
| DeepSeek V4 Pro (0813)Open | DeepSeek | 1.459 | 53.0 | 93.0 | 79.0 | 41.0 | 49.0 | $1.3 | $4.0 | 1M |
| GPT-5.6 Luna | OpenAI | 1.453 | 47.0 | 89.0 | 70.0 | 33.0 | 51.0 | $0.20 | $1.2 | 1M |
| MiniMax-M3Open | MiniMax | 1.443 | 45.0 | 93.0 | 65.0 | 39.0 | 45.0 | $0.30 | $1.2 | 1M |
| Mistral Medium 3.5Open | Mistral | 1.427 | 30.0 | 75.0 | 51.0 | 14.0 | 40.0 | $1.5 | $7.5 | 256K |
| Mistral Large 3Open | Mistral | 1.414 | 16.0 | 68.0 | 12.0 | 4.0 | 36.0 | $0.50 | $1.5 | 256K |
| Claude Haiku 4.5 | Anthropic | 1.413 | 30.0 | 67.0 | 44.0 | 10.0 | 43.0 | $1 | $5 | 200K |
| Claude Fable 5.1 | Anthropic | – | 66.0 | 94.0 | 91.0 | 59.0 | 62.0 | $10 | $50 | 1M |
Claude Fable 5
Anthropic
1.508
Elo
AA-Index
62.0
GPQA
93.0
Terminal
85.0
HLE
55.0
SciCode
60.0
Muse Spark 1.2
Meta
1.499
Elo
AA-Index
57.0
GPQA
90.0
Terminal
80.0
HLE
45.0
SciCode
56.0
Claude Opus 5
Anthropic
1.492
Elo
AA-Index
61.0
GPQA
94.0
Terminal
88.0
HLE
53.0
SciCode
54.0
Gemini 3.7 Flash
1.491
Elo
AA-Index
56.0
GPQA
95.0
Terminal
86.0
HLE
48.0
SciCode
57.0
Kimi K3
Moonshot
1.489
Elo
AA-Index
60.0
GPQA
94.0
Terminal
85.0
HLE
47.0
SciCode
59.0
Gemini 3.1 Pro
1.487
Elo
AA-Index
48.0
GPQA
94.0
Terminal
74.0
HLE
47.0
SciCode
59.0
GPT-5.6 Sol
OpenAI
1.483
Elo
AA-Index
57.0
GPQA
93.0
Terminal
87.0
HLE
46.0
SciCode
57.0
GLM-5.3
Z.AI
1.482
Elo
AA-Index
60.0
GPQA
92.0
Terminal
84.0
HLE
42.0
SciCode
56.0
Gemini 3.6 Flash
1.480
Elo
AA-Index
52.0
GPQA
93.0
Terminal
78.0
HLE
41.0
SciCode
53.0
Qwen3.8 Max
Alibaba
1.479
Elo
AA-Index
58.0
GPQA
93.0
Terminal
81.0
HLE
43.0
SciCode
53.0
ERNIE 5.1
Baidu
1.468
Elo
AA-Index
–
GPQA
–
Terminal
–
HLE
–
SciCode
–
GPT-5.6 Terra
OpenAI
1.466
Elo
AA-Index
50.0
GPQA
90.0
Terminal
76.0
HLE
39.0
SciCode
50.0
Claude Sonnet 5
Anthropic
1.462
Elo
AA-Index
55.0
GPQA
91.0
Terminal
81.0
HLE
41.0
SciCode
54.0
Grok 4.6
xAI
1.461
Elo
AA-Index
61.0
GPQA
95.0
Terminal
88.0
HLE
43.0
SciCode
54.0
DeepSeek V4 Pro (0813)
DeepSeek
1.459
Elo
AA-Index
53.0
GPQA
93.0
Terminal
79.0
HLE
41.0
SciCode
49.0
GPT-5.6 Luna
OpenAI
1.453
Elo
AA-Index
47.0
GPQA
89.0
Terminal
70.0
HLE
33.0
SciCode
51.0
MiniMax-M3
MiniMax
1.443
Elo
AA-Index
45.0
GPQA
93.0
Terminal
65.0
HLE
39.0
SciCode
45.0
Mistral Medium 3.5
Mistral
1.427
Elo
AA-Index
30.0
GPQA
75.0
Terminal
51.0
HLE
14.0
SciCode
40.0
Mistral Large 3
Mistral
1.414
Elo
AA-Index
16.0
GPQA
68.0
Terminal
12.0
HLE
4.0
SciCode
36.0
Claude Haiku 4.5
Anthropic
1.413
Elo
AA-Index
30.0
GPQA
67.0
Terminal
44.0
HLE
10.0
SciCode
43.0
Claude Fable 5.1
Anthropic
Elo
AA-Index
66.0
GPQA
94.0
Terminal
91.0
HLE
59.0
SciCode
62.0
Was messen diese Benchmarks?
Arena Elo
↑ Höher = besserCrowdsourced Blind-Voting: Echte Nutzer vergleichen zwei anonyme Modelle und wählen das bessere. Gilt als realistischster Qualitätsindikator, weil er menschliche Präferenz direkt misst. Die Skala wurde Anfang 2026 rekalibriert, Werte sind nicht mit älteren Snapshots vergleichbar.
Quelle: Arena (ehem. LMArena / LMSYS) →AA-Index
↑ Höher = besserSammelwert aus neun Einzeltests, darunter GPQA Diamond, Humanity's Last Exam, Terminal-Bench und SciCode. Artificial Analysis misst alle Tests selbst und unter gleichen Bedingungen, deshalb sind die Werte untereinander gut vergleichbar. Skala 0 bis 100, die Spitze liegt aktuell bei 66.
Quelle: Artificial Analysis →GPQA
↑ Höher = besserFragen auf Doktoranden-Niveau in Physik, Chemie und Biologie. Fachexperten erreichen nur rund 65 Prozent. Die Spitzenmodelle liegen inzwischen bei über 90 Prozent, der Benchmark nähert sich damit seiner Sättigung.
Quelle: Rein et al., NYU, erhoben von Artificial Analysis →Terminal-Bench
↑ Höher = besserAgentische Aufgaben in einer echten Shell: Das Modell muss Kommandos absetzen, Ausgaben lesen und sich zum Ziel vorarbeiten. Hat SWE-bench als Referenz für praktische Coding-Fähigkeit weitgehend abgelöst, weil er den kompletten Werkzeugeinsatz prüft statt nur den Patch.
Quelle: Stanford / Laude Institute, erhoben von Artificial Analysis →HLE
↑ Höher = besserRund 2.500 Expertenfragen aus über hundert Fachgebieten, bewusst so gebaut, dass Suchmaschinen und Auswendiglernen nicht helfen. Bewusst weit von der Sättigung entfernt: Selbst die stärksten Modelle liegen erst bei knapp 60 Prozent.
Quelle: Center for AI Safety / Scale AI, erhoben von Artificial Analysis →SciCode
↑ Höher = besserProgrammieraufgaben aus der echten Forschung: Physik, Biologie und Materialwissenschaft. Das Modell muss wissenschaftliche Verfahren in lauffähigen Code übersetzen, nicht nur Syntax beherrschen.
Quelle: Tian et al., erhoben von Artificial Analysis →Kosten-Effizienz: Qualität pro Dollar
Der reine Benchmark-Score sagt wenig über den Praxiswert, wenn ein Modell 10× mehr kostet. Deshalb lohnt sich der Blick auf das Verhältnis von Qualität zu Kosten.
Tipp: Sortiere die Tabelle oben nach „$/1M Out“ (Kosten pro Million Output-Tokens) und vergleiche mit dem Arena-Elo-Score. Modelle wie DeepSeek V4 Pro, MiniMax-M3 oder GLM-5.3 bieten starke Leistung zu einem Bruchteil der Kosten der Flaggschiff-Modelle.
Für die meisten Business-Anwendungen ist nicht das beste Modell die richtige Wahl, sondern das effizienteste, das die eigene Qualitätsschwelle erreicht.
GPT-5.6 Luna
OpenAI
MiniMax-M3
MiniMax
Mistral Large 3
Mistral
Methodik & Quellen
Anerkannte Benchmarks
Chatbot Arena (Blind-Voting) sowie der Artificial Analysis Intelligence Index mit GPQA Diamond, Terminal-Bench, Humanity's Last Exam und SciCode. MMLU-Pro, SWE-bench und AIME sind im Juli 2026 entfallen, weil sie in der aktuellen Index-Version nicht mehr erhoben werden. Fehlende Werte bleiben leer statt geschätzt.
Aktuelle Preise
Offizielle API-Preise, erhoben von Artificial Analysis. Preise können sich ändern, Stand ist das angezeigte Aktualisierungsdatum.
Redaktionelle Bewertung
Use-Case-Ratings (1–5 Sterne) sind aus den Benchmarks abgeleitet: Chat aus dem Arena-Elo, Coding aus Terminal-Bench, Reasoning aus dem AA-Index, Lange Dokumente aus dem Kontextfenster. Benchmark-Scores sind gemessen, die Sterne eine Einordnung.
Alle Quellen
Eine Einschränkung, die man kennen sollte: Reasoning-Modelle laufen in mehreren Effort-Stufen, und die beiden Quellen testen nicht immer dieselbe. Arena-Elo und AA-Index einer Zeile können daher aus unterschiedlichen Konfigurationen desselben Modells stammen. Modelle, die nur eine der beiden Quellen führt, haben in der anderen Spalte einen Strich.
Letzte Aktualisierung: 2. September 2026 · Daten fehlen oder veraltet? Melden →