ModelVerdict

Unabhängige Benchmarks von KI-Modellen für Büroarbeit

Welches Modell erledigt Ihre Dokumente in Ihrer Sprache – und was kostet es wirklich?

Jede Woche lassen wir kommerzielle und offene Modelle dieselben Büroaufgaben lösen: Rechnungen, Kunden-E-Mails, personenbezogene Daten und Verträge, als Nächstes Zusammenfassungen und Fragen zu Dokumenten. Jede Zahl führt zur tatsächlichen Modellausgabe und zu den echten Kosten, einschließlich der Korrektur seiner Fehler.

Letzter Lauf 28. September 2026 · 10 Modelle · Dokumente: Deutsch, Englisch (USA), Tschechisch

Ranglisten nach Aufgabe

Sortiert nach Genauigkeit. Die Kosten enthalten bereits die Sprachsteuer auf Tokens. Schwelle: 95 %.

#ModellGenauigkeitPro 1.000SprachsteuerDaten in der EU
1Gemini 3.5 Flash Lite
Google
100,0 %erreicht die Schwelle
0,95 €×1,33Ja
2GPT-6 Sol
OpenAI
99,9 %erreicht die Schwelle
9,62 €×1,29Ja
3DeepSeek V4.1 Flash
DeepSeek · Open Weights
99,6 %erreicht die Schwelle
0,51 €×1,59Nur Self-Hosting
4GPT-6 Luna
OpenAI
99,3 %erreicht die Schwelle
0,49 €×1,29Ja
5Claude Sonnet 5
Anthropic
98,8 %erreicht die Schwelle
9,48 €×1,88Ja
6Gemini 3.8 Flash
Google
97,9 %erreicht die Schwelle
6,63 €×1,32Nein
7Mistral Medium 3.5
Mistral
97,2 %erreicht die Schwelle
4,35 €×1,39Ja
8Qwen3.8 Flash
Qwen
94,4 %unter der Schwelle
1,03 €×1,28Nein
9Mistral Small 4
Mistral · Open Weights
94,0 %unter der Schwelle
0,41 €—Ja
10Gemma 4 31B
Google · Open Weights
93,6 %unter der Schwelle
0,18 €×1,33Nur Self-Hosting

Vollständige Rangliste und Filter →