Zum Inhalt springen
← Zurück zum KI-Monitor
LLM BenchmarkAktualisiert: 2. September 2026

Welche KI ist die beste? Alle Modelle im Vergleich.

21 aktuelle KI-Modelle, verglichen nach 6 anerkannten Benchmarks und realen Kosten. Sortierbar, filterbar, kein Marketing, nur Daten.

Von Chatbot Arena Elo (menschliche Bewertung) über GPQA (Expertenwissen) bis Terminal-Bench (agentisches Programmieren), plus Preise pro Million Tokens für einen ehrlichen Kosten-Vergleich.

21

Modelle

6

Benchmarks

12

Anbieter

5

Quellen

LLM Ranking, Alle Modelle

Klicke auf eine Spaltenüberschrift zum Sortieren. Filtere nach Use Case, Anbieter oder Open-Source-Status.

Use Case

Anbieter

21 von 21 Modellen

Claude Fable 5

Anthropic

1.508

Elo

AA-Index

62.0

GPQA

93.0

Terminal

85.0

HLE

55.0

SciCode

60.0

In: $10Out: $50
1M🖼️

Muse Spark 1.2

Meta

1.499

Elo

AA-Index

57.0

GPQA

90.0

Terminal

80.0

HLE

45.0

SciCode

56.0

In: $1.3Out: $4.3
1.0M🖼️

Claude Opus 5

Anthropic

1.492

Elo

AA-Index

61.0

GPQA

94.0

Terminal

88.0

HLE

53.0

SciCode

54.0

In: $5Out: $25
1M🖼️

Gemini 3.7 Flash

Google

1.491

Elo

AA-Index

56.0

GPQA

95.0

Terminal

86.0

HLE

48.0

SciCode

57.0

In: $0.75Out: $3.8
1M🖼️

Kimi K3

Moonshot

1.489

Elo

AA-Index

60.0

GPQA

94.0

Terminal

85.0

HLE

47.0

SciCode

59.0

In: $3Out: $15
1.0M🖼️Open

Gemini 3.1 Pro

Google

1.487

Elo

AA-Index

48.0

GPQA

94.0

Terminal

74.0

HLE

47.0

SciCode

59.0

In: $2Out: $12
1M🖼️

GPT-5.6 Sol

OpenAI

1.483

Elo

AA-Index

57.0

GPQA

93.0

Terminal

87.0

HLE

46.0

SciCode

57.0

In: $4Out: $20
1M🖼️

GLM-5.3

Z.AI

1.482

Elo

AA-Index

60.0

GPQA

92.0

Terminal

84.0

HLE

42.0

SciCode

56.0

In: $1.4Out: $4.4
1M🖼️Open

Gemini 3.6 Flash

Google

1.480

Elo

AA-Index

52.0

GPQA

93.0

Terminal

78.0

HLE

41.0

SciCode

53.0

In: $0.75Out: $3.8
1M🖼️

Qwen3.8 Max

Alibaba

1.479

Elo

AA-Index

58.0

GPQA

93.0

Terminal

81.0

HLE

43.0

SciCode

53.0

In: $2Out: $6
1M🖼️

ERNIE 5.1

Baidu

1.468

Elo

AA-Index

GPQA

Terminal

HLE

SciCode

In: Out:
🖼️

GPT-5.6 Terra

OpenAI

1.466

Elo

AA-Index

50.0

GPQA

90.0

Terminal

76.0

HLE

39.0

SciCode

50.0

In: $2Out: $12
1M🖼️

Claude Sonnet 5

Anthropic

1.462

Elo

AA-Index

55.0

GPQA

91.0

Terminal

81.0

HLE

41.0

SciCode

54.0

In: $2Out: $10
1M🖼️

Grok 4.6

xAI

1.461

Elo

AA-Index

61.0

GPQA

95.0

Terminal

88.0

HLE

43.0

SciCode

54.0

In: $2Out: $6
500K🖼️

DeepSeek V4 Pro (0813)

DeepSeek

1.459

Elo

AA-Index

53.0

GPQA

93.0

Terminal

79.0

HLE

41.0

SciCode

49.0

In: $1.3Out: $4.0
1MOpen

GPT-5.6 Luna

OpenAI

1.453

Elo

AA-Index

47.0

GPQA

89.0

Terminal

70.0

HLE

33.0

SciCode

51.0

In: $0.20Out: $1.2
1M🖼️

MiniMax-M3

MiniMax

1.443

Elo

AA-Index

45.0

GPQA

93.0

Terminal

65.0

HLE

39.0

SciCode

45.0

In: $0.30Out: $1.2
1M🖼️Open

Mistral Medium 3.5

Mistral

1.427

Elo

AA-Index

30.0

GPQA

75.0

Terminal

51.0

HLE

14.0

SciCode

40.0

In: $1.5Out: $7.5
256K🖼️Open

Mistral Large 3

Mistral

1.414

Elo

AA-Index

16.0

GPQA

68.0

Terminal

12.0

HLE

4.0

SciCode

36.0

In: $0.50Out: $1.5
256K🖼️Open

Claude Haiku 4.5

Anthropic

1.413

Elo

AA-Index

30.0

GPQA

67.0

Terminal

44.0

HLE

10.0

SciCode

43.0

In: $1Out: $5
200K🖼️

Claude Fable 5.1

Anthropic

Elo

AA-Index

66.0

GPQA

94.0

Terminal

91.0

HLE

59.0

SciCode

62.0

In: $10Out: $50
1M🖼️
Elo = Chatbot Arena RankingAA-Index = Artificial Analysis Intelligence IndexGPQA = ExpertenwissenTerminal = Terminal-Bench (agentisches Coding)HLE = Humanity’s Last ExamSciCode = wissenschaftliches Programmieren$/1M = USD pro 1 Million Tokens– = nicht berichtet

Was messen diese Benchmarks?

Arena Elo

↑ Höher = besser

Crowdsourced Blind-Voting: Echte Nutzer vergleichen zwei anonyme Modelle und wählen das bessere. Gilt als realistischster Qualitätsindikator, weil er menschliche Präferenz direkt misst. Die Skala wurde Anfang 2026 rekalibriert, Werte sind nicht mit älteren Snapshots vergleichbar.

Quelle: Arena (ehem. LMArena / LMSYS)

AA-Index

↑ Höher = besser

Sammelwert aus neun Einzeltests, darunter GPQA Diamond, Humanity's Last Exam, Terminal-Bench und SciCode. Artificial Analysis misst alle Tests selbst und unter gleichen Bedingungen, deshalb sind die Werte untereinander gut vergleichbar. Skala 0 bis 100, die Spitze liegt aktuell bei 66.

Quelle: Artificial Analysis

GPQA

↑ Höher = besser

Fragen auf Doktoranden-Niveau in Physik, Chemie und Biologie. Fachexperten erreichen nur rund 65 Prozent. Die Spitzenmodelle liegen inzwischen bei über 90 Prozent, der Benchmark nähert sich damit seiner Sättigung.

Quelle: Rein et al., NYU, erhoben von Artificial Analysis

Terminal-Bench

↑ Höher = besser

Agentische Aufgaben in einer echten Shell: Das Modell muss Kommandos absetzen, Ausgaben lesen und sich zum Ziel vorarbeiten. Hat SWE-bench als Referenz für praktische Coding-Fähigkeit weitgehend abgelöst, weil er den kompletten Werkzeugeinsatz prüft statt nur den Patch.

Quelle: Stanford / Laude Institute, erhoben von Artificial Analysis

HLE

↑ Höher = besser

Rund 2.500 Expertenfragen aus über hundert Fachgebieten, bewusst so gebaut, dass Suchmaschinen und Auswendiglernen nicht helfen. Bewusst weit von der Sättigung entfernt: Selbst die stärksten Modelle liegen erst bei knapp 60 Prozent.

Quelle: Center for AI Safety / Scale AI, erhoben von Artificial Analysis

SciCode

↑ Höher = besser

Programmieraufgaben aus der echten Forschung: Physik, Biologie und Materialwissenschaft. Das Modell muss wissenschaftliche Verfahren in lauffähigen Code übersetzen, nicht nur Syntax beherrschen.

Quelle: Tian et al., erhoben von Artificial Analysis

Kosten-Effizienz: Qualität pro Dollar

Der reine Benchmark-Score sagt wenig über den Praxiswert, wenn ein Modell 10× mehr kostet. Deshalb lohnt sich der Blick auf das Verhältnis von Qualität zu Kosten.

Tipp: Sortiere die Tabelle oben nach „$/1M Out“ (Kosten pro Million Output-Tokens) und vergleiche mit dem Arena-Elo-Score. Modelle wie DeepSeek V4 Pro, MiniMax-M3 oder GLM-5.3 bieten starke Leistung zu einem Bruchteil der Kosten der Flaggschiff-Modelle.

Für die meisten Business-Anwendungen ist nicht das beste Modell die richtige Wahl, sondern das effizienteste, das die eigene Qualitätsschwelle erreicht.

#1

GPT-5.6 Luna

OpenAI

Elo / $ Output1.211
Arena Elo1.453
Output-Preis$1.2/1M
#2

MiniMax-M3

MiniMax

Elo / $ Output1.203
Arena Elo1.443
Output-Preis$1.2/1M
#3

Mistral Large 3

Mistral

Elo / $ Output943
Arena Elo1.414
Output-Preis$1.5/1M

Methodik & Quellen

Anerkannte Benchmarks

Chatbot Arena (Blind-Voting) sowie der Artificial Analysis Intelligence Index mit GPQA Diamond, Terminal-Bench, Humanity's Last Exam und SciCode. MMLU-Pro, SWE-bench und AIME sind im Juli 2026 entfallen, weil sie in der aktuellen Index-Version nicht mehr erhoben werden. Fehlende Werte bleiben leer statt geschätzt.

Aktuelle Preise

Offizielle API-Preise, erhoben von Artificial Analysis. Preise können sich ändern, Stand ist das angezeigte Aktualisierungsdatum.

Redaktionelle Bewertung

Use-Case-Ratings (1–5 Sterne) sind aus den Benchmarks abgeleitet: Chat aus dem Arena-Elo, Coding aus Terminal-Bench, Reasoning aus dem AA-Index, Lange Dokumente aus dem Kontextfenster. Benchmark-Scores sind gemessen, die Sterne eine Einordnung.

Alle Quellen

Eine Einschränkung, die man kennen sollte: Reasoning-Modelle laufen in mehreren Effort-Stufen, und die beiden Quellen testen nicht immer dieselbe. Arena-Elo und AA-Index einer Zeile können daher aus unterschiedlichen Konfigurationen desselben Modells stammen. Modelle, die nur eine der beiden Quellen führt, haben in der anderen Spalte einen Strich.

← Zurück zum KI-Monitor

Letzte Aktualisierung: 2. September 2026 · Daten fehlen oder veraltet? Melden →

Diese Website verwendet Cookies. Notwendige Cookies sind immer aktiv. Analyse-Cookies (Ahrefs, PostHog) helfen mir anonym zu verstehen, welche Inhalte hilfreich sind.