ModelVerdict

Sprachlücke

Sprachlücke: Wie viel schlechter ist ein Modell außerhalb des Englischen?

Gleiche Art von Rechnungen, gleiche Anweisungen, andere Sprache. Die Lücke zeigt, wie viel Genauigkeit ein Modell bei Dokumenten in einer anderen Sprache im Vergleich zu englischen verliert.

ModellRichtige Felder 82 % – 100 %EnglischDeutschLückeFehlerfreie Dokumente (Deutsch / Englisch)
Qwen3.8 Flash
Qwen
82,4 %93,4 %+11,0 Pp.87 % / 57 %
Qwen3.8 Flash
Qwen
82,4 %91,3 %+9,0 Pp.77 % / 57 %
Qwen3.8 Flash
Qwen
82,4 %90,5 %+8,1 Pp.82 % / 57 %
Qwen3.8 Flash
Qwen
82,4 %88,2 %+5,8 Pp.78 % / 57 %
Mistral Small 4
Mistral
95,6 %97,5 %+1,9 Pp.77 % / 58 %
Gemini 3.5 Flash Lite
Google
99,2 %100,0 %+0,8 Pp.100 % / 92 %
DeepSeek V4.1 Flash
DeepSeek
99,4 %99,9 %+0,5 Pp.99 % / 93 %
Gemini 3.5 Flash Lite
Google
99,2 %99,6 %+0,4 Pp.96 % / 92 %
Mistral Medium 3.5
Mistral
97,8 %98,1 %+0,4 Pp.81 % / 79 %
Mistral Medium 3.5
Mistral
97,8 %98,0 %+0,2 Pp.83 % / 79 %
DeepSeek V4.1 Flash
DeepSeek
99,4 %99,6 %+0,2 Pp.95 % / 93 %
Claude Sonnet 5
Anthropic
99,8 %100,0 %+0,2 Pp.100 % / 99 %
Gemini 3.5 Flash Lite
Google
99,2 %99,4 %+0,2 Pp.93 % / 92 %
Gemini 3.8 Flash
Google
99,8 %99,9 %+0,1 Pp.99 % / 98 %
Gemini 3.8 Flash
Google
99,8 %99,9 %+0,1 Pp.99 % / 98 %
DeepSeek V4.1 Flash
DeepSeek
99,4 %99,4 %−0,0 Pp.93 % / 93 %
GPT-6 Sol
OpenAI
99,9 %99,9 %−0,0 Pp.99 % / 99 %
GPT-6 Sol
OpenAI
99,9 %99,9 %−0,0 Pp.99 % / 99 %
GPT-6 Sol
OpenAI
99,9 %99,9 %−0,1 Pp.99 % / 99 %
Mistral Medium 3.5
Mistral
97,8 %97,6 %−0,1 Pp.75 % / 79 %
Mistral Small 4
Mistral
95,6 %95,4 %−0,2 Pp.56 % / 58 %
Mistral Small 4
Mistral
95,6 %95,2 %−0,4 Pp.65 % / 58 %
GPT-6 Luna
OpenAI
99,7 %99,3 %−0,4 Pp.94 % / 97 %
GPT-6 Luna
OpenAI
99,7 %99,2 %−0,5 Pp.91 % / 97 %
Gemini 3.5 Flash Lite
Google
99,2 %98,6 %−0,6 Pp.85 % / 92 %
GPT-6 Luna
OpenAI
99,7 %98,9 %−0,8 Pp.88 % / 97 %
GPT-6 Luna
OpenAI
99,7 %98,9 %−0,8 Pp.88 % / 97 %
GPT-6 Sol
OpenAI
99,9 %99,0 %−0,9 Pp.89 % / 99 %
Claude Sonnet 5
Anthropic
99,8 %98,8 %−1,0 Pp.87 % / 99 %
Mistral Small 4
Mistral
95,6 %94,5 %−1,1 Pp.53 % / 58 %
Claude Sonnet 5
Anthropic
99,8 %98,6 %−1,2 Pp.96 % / 99 %
DeepSeek V4.1 Flash
DeepSeek
99,4 %98,0 %−1,3 Pp.78 % / 93 %
Gemma 4 31B
Google
97,6 %96,1 %−1,5 Pp.67 % / 81 %
Gemma 4 31B
Google
97,6 %95,2 %−2,4 Pp.67 % / 81 %
Gemini 3.8 Flash
Google
99,8 %97,3 %−2,5 Pp.97 % / 98 %
Mistral Medium 3.5
Mistral
97,8 %94,9 %−2,9 Pp.67 % / 79 %
Gemma 4 31B
Google
97,6 %94,7 %−3,0 Pp.54 % / 81 %
Gemini 3.8 Flash
Google
99,8 %95,9 %−3,9 Pp.95 % / 98 %
Gemma 4 31B
Google
97,6 %93,3 %−4,3 Pp.52 % / 81 %
Claude Sonnet 5
Anthropic
99,8 %93,4 %−6,5 Pp.77 % / 99 %

Verglichen werden nur Felder, die in beiden Versionen des Dokuments vorkommen (Lieferant, Lieferanten-ID (EIN, IČO…), Rechnungsnummer, Zahlungsreferenz, Rechnungsdatum, Fälligkeitsdatum, Netto nach Steuersatz, Steuer nach Steuersatz, Gesamtbetrag, Währung, Bankverbindung). US-Rechnungen haben keine USt-IdNr. und kein Leistungsdatum, daher entfallen diese Felder.