Zum Inhalt springen
← Zurück zum KI-Monitor
LLM BenchmarkAktualisiert: 25. Juli 2026

Welche KI ist die beste? Alle Modelle im Vergleich.

20 aktuelle KI-Modelle, verglichen nach 6 anerkannten Benchmarks und realen Kosten. Sortierbar, filterbar, kein Marketing, nur Daten.

Von Chatbot Arena Elo (menschliche Bewertung) über GPQA (Expertenwissen) bis Terminal-Bench (agentisches Programmieren), plus Preise pro Million Tokens für einen ehrlichen Kosten-Vergleich.

20

Modelle

6

Benchmarks

12

Anbieter

5

Quellen

LLM Ranking, Alle Modelle

Klicke auf eine Spaltenüberschrift zum Sortieren. Filtere nach Use Case, Anbieter oder Open-Source-Status.

Use Case

Anbieter

20 von 20 Modellen

Claude Fable 5

Anthropic

1,507

Elo

AA-Index

60.0

GPQA

93.0

Terminal

85.0

HLE

53.0

SciCode

60.0

In: $10Out: $50
1M🖼️

Muse Spark 1.1

Meta

1,495

Elo

AA-Index

51.0

GPQA

90.0

Terminal

78.0

HLE

45.0

SciCode

58.0

In: $1.3Out: $4.3
1.1M🖼️

Gemini 3.1 Pro

Google

1,486

Elo

AA-Index

46.0

GPQA

94.0

Terminal

74.0

HLE

45.0

SciCode

59.0

In: $2Out: $12
1M🖼️

Kimi K3

Moonshot

1,486

Elo

AA-Index

57.0

GPQA

94.0

Terminal

85.0

HLE

44.0

SciCode

59.0

In: $3Out: $15
1.1M🖼️

GPT-5.6 Sol

OpenAI

1,485

Elo

AA-Index

56.0

GPQA

93.0

Terminal

87.0

HLE

44.0

SciCode

57.0

In: $5Out: $30
1M🖼️

Gemini 3.6 Flash

Google

1,485

Elo

AA-Index

50.0

GPQA

93.0

Terminal

78.0

HLE

38.0

SciCode

53.0

In: $1.5Out: $7.5
1M🖼️

Gemini 3.5 Flash

Google

1,476

Elo

AA-Index

50.0

GPQA

92.0

Terminal

79.0

HLE

41.0

SciCode

53.0

In: $1.5Out: $9
1M🖼️

Qwen3.7 Max

Alibaba

1,475

Elo

AA-Index

46.0

GPQA

92.0

Terminal

75.0

HLE

38.0

SciCode

49.0

In: $2.5Out: $7.5
1M🖼️

GLM-5.2

Z.AI

1,469

Elo

AA-Index

51.0

GPQA

89.0

Terminal

78.0

HLE

40.0

SciCode

50.0

In: $1.4Out: $4.4
1M🖼️Open

Grok 4.5

xAI

1,468

Elo

AA-Index

54.0

GPQA

93.0

Terminal

82.0

HLE

40.0

SciCode

54.0

In: $2Out: $6
500K🖼️

ERNIE 5.1

Baidu

1,468

Elo

AA-Index

GPQA

Terminal

HLE

SciCode

In: Out:
🖼️

Claude Sonnet 5

Anthropic

1,461

Elo

AA-Index

53.0

GPQA

91.0

Terminal

81.0

HLE

40.0

SciCode

54.0

In: $2Out: $10
1M🖼️

DeepSeek V4 Pro

DeepSeek

1,457

Elo

AA-Index

44.0

GPQA

89.0

Terminal

64.0

HLE

36.0

SciCode

50.0

In: $0.43Out: $0.87
1MOpen

MiniMax-M3

MiniMax

1,444

Elo

AA-Index

44.0

GPQA

93.0

Terminal

65.0

HLE

37.0

SciCode

45.0

In: $0.30Out: $1.2
1M🖼️Open

Mistral Medium 3.5

Mistral

1,427

Elo

AA-Index

30.0

GPQA

75.0

Terminal

51.0

HLE

13.0

SciCode

40.0

In: $1.5Out: $7.5
256K🖼️Open

Mistral Large 3

Mistral

1,415

Elo

AA-Index

16.0

GPQA

68.0

Terminal

12.0

HLE

4.0

SciCode

36.0

In: $0.50Out: $1.5
256K🖼️Open

Claude Haiku 4.5

Anthropic

1,412

Elo

AA-Index

30.0

GPQA

67.0

Terminal

44.0

HLE

10.0

SciCode

43.0

In: $1Out: $5
200K🖼️

Claude Opus 5

Anthropic

Elo

AA-Index

59.0

GPQA

94.0

Terminal

88.0

HLE

51.0

SciCode

54.0

In: $5Out: $25
1M🖼️

GPT-5.6 Terra

OpenAI

Elo

AA-Index

49.0

GPQA

90.0

Terminal

76.0

HLE

37.0

SciCode

50.0

In: $2.5Out: $15
1M🖼️

GPT-5.6 Luna

OpenAI

Elo

AA-Index

46.0

GPQA

89.0

Terminal

70.0

HLE

32.0

SciCode

51.0

In: $1Out: $6
1M🖼️
Elo = Chatbot Arena RankingAA-Index = Artificial Analysis Intelligence IndexGPQA = ExpertenwissenTerminal = Terminal-Bench (agentisches Coding)HLE = Humanity’s Last ExamSciCode = wissenschaftliches Programmieren$/1M = USD pro 1 Million Tokens– = nicht berichtet

Was messen diese Benchmarks?

Arena Elo

↑ Höher = besser

Crowdsourced Blind-Voting: Echte Nutzer vergleichen zwei anonyme Modelle und wählen das bessere. Gilt als realistischster Qualitätsindikator, weil er menschliche Präferenz direkt misst. Die Skala wurde Anfang 2026 rekalibriert, Werte sind nicht mit älteren Snapshots vergleichbar.

Quelle: Arena (ehem. LMArena / LMSYS)

AA-Index

↑ Höher = besser

Sammelwert aus neun Einzeltests, darunter GPQA Diamond, Humanity's Last Exam, Terminal-Bench und SciCode. Artificial Analysis misst alle Tests selbst und unter gleichen Bedingungen, deshalb sind die Werte untereinander gut vergleichbar. Skala 0 bis 100, die Spitze liegt aktuell bei etwa 60.

Quelle: Artificial Analysis

GPQA

↑ Höher = besser

Fragen auf Doktoranden-Niveau in Physik, Chemie und Biologie. Fachexperten erreichen nur rund 65 Prozent. Die Spitzenmodelle liegen inzwischen bei über 90 Prozent, der Benchmark nähert sich damit seiner Sättigung.

Quelle: Rein et al., NYU, erhoben von Artificial Analysis

Terminal-Bench

↑ Höher = besser

Agentische Aufgaben in einer echten Shell: Das Modell muss Kommandos absetzen, Ausgaben lesen und sich zum Ziel vorarbeiten. Hat SWE-bench als Referenz für praktische Coding-Fähigkeit weitgehend abgelöst, weil er den kompletten Werkzeugeinsatz prüft statt nur den Patch.

Quelle: Stanford / Laude Institute, erhoben von Artificial Analysis

HLE

↑ Höher = besser

Rund 2.500 Expertenfragen aus über hundert Fachgebieten, bewusst so gebaut, dass Suchmaschinen und Auswendiglernen nicht helfen. Bewusst weit von der Sättigung entfernt: Selbst die stärksten Modelle liegen erst bei etwa der Hälfte.

Quelle: Center for AI Safety / Scale AI, erhoben von Artificial Analysis

SciCode

↑ Höher = besser

Programmieraufgaben aus der echten Forschung: Physik, Biologie und Materialwissenschaft. Das Modell muss wissenschaftliche Verfahren in lauffähigen Code übersetzen, nicht nur Syntax beherrschen.

Quelle: Tian et al., erhoben von Artificial Analysis

Kosten-Effizienz: Qualität pro Dollar

Der reine Benchmark-Score sagt wenig über den Praxiswert, wenn ein Modell 10× mehr kostet. Deshalb lohnt sich der Blick auf das Verhältnis von Qualität zu Kosten.

Tipp: Sortiere die Tabelle oben nach „$/1M Out“ (Kosten pro Million Output-Tokens) und vergleiche mit dem Arena-Elo-Score. Modelle wie DeepSeek V4 Pro, MiniMax-M3 oder GLM-5.2 bieten starke Leistung zu einem Bruchteil der Kosten der Flaggschiff-Modelle.

Für die meisten Business-Anwendungen ist nicht das beste Modell die richtige Wahl, sondern das effizienteste, das die eigene Qualitätsschwelle erreicht.

#1

DeepSeek V4 Pro

DeepSeek

Elo / $ Output1,675
Arena Elo1,457
Output-Preis$0.87/1M
#2

MiniMax-M3

MiniMax

Elo / $ Output1,203
Arena Elo1,444
Output-Preis$1.2/1M
#3

Mistral Large 3

Mistral

Elo / $ Output943
Arena Elo1,415
Output-Preis$1.5/1M

Methodik & Quellen

Anerkannte Benchmarks

Chatbot Arena (Blind-Voting) sowie der Artificial Analysis Intelligence Index mit GPQA Diamond, Terminal-Bench, Humanity's Last Exam und SciCode. MMLU-Pro, SWE-bench und AIME sind im Juli 2026 entfallen, weil sie in der aktuellen Index-Version nicht mehr erhoben werden. Fehlende Werte bleiben leer statt geschätzt.

Aktuelle Preise

Offizielle API-Preise, erhoben von Artificial Analysis. Preise können sich ändern, Stand ist das angezeigte Aktualisierungsdatum.

Redaktionelle Bewertung

Use-Case-Ratings (1–5 Sterne) sind aus den Benchmarks abgeleitet: Chat aus dem Arena-Elo, Coding aus Terminal-Bench, Reasoning aus dem AA-Index, Lange Dokumente aus dem Kontextfenster. Benchmark-Scores sind gemessen, die Sterne eine Einordnung.

Alle Quellen

Eine Einschränkung, die man kennen sollte: Reasoning-Modelle laufen in mehreren Effort-Stufen, und die beiden Quellen testen nicht immer dieselbe. Arena-Elo und AA-Index einer Zeile können daher aus unterschiedlichen Konfigurationen desselben Modells stammen. Modelle, die nur eine der beiden Quellen führt, haben in der anderen Spalte einen Strich.

← Zurück zum KI-Monitor

Letzte Aktualisierung: 25. Juli 2026 · Daten fehlen oder veraltet? Melden →

Diese Website verwendet Cookies. Notwendige Cookies sind immer aktiv. Analyse-Cookies (Ahrefs, PostHog) helfen mir anonym zu verstehen, welche Inhalte hilfreich sind.