Sprachlücke
Sprachlücke: Wie viel schlechter ist ein Modell außerhalb des Englischen?
Gleiche Art von Rechnungen, gleiche Anweisungen, andere Sprache. Die Lücke zeigt, wie viel Genauigkeit ein Modell bei Dokumenten in einer anderen Sprache im Vergleich zu englischen verliert.
| Modell | Richtige Felder 82 % – 100 % | Englisch | Deutsch | Lücke | Fehlerfreie Dokumente (Deutsch / Englisch) |
|---|---|---|---|---|---|
| Qwen3.8 Flash Qwen | 82,4 % | 93,4 % | +11,0 Pp. | 87 % / 57 % | |
| Qwen3.8 Flash Qwen | 82,4 % | 91,3 % | +9,0 Pp. | 77 % / 57 % | |
| Qwen3.8 Flash Qwen | 82,4 % | 90,5 % | +8,1 Pp. | 82 % / 57 % | |
| Qwen3.8 Flash Qwen | 82,4 % | 88,2 % | +5,8 Pp. | 78 % / 57 % | |
| Mistral Small 4 Mistral | 95,6 % | 97,5 % | +1,9 Pp. | 77 % / 58 % | |
| Gemini 3.5 Flash Lite | 99,2 % | 100,0 % | +0,8 Pp. | 100 % / 92 % | |
| DeepSeek V4.1 Flash DeepSeek | 99,4 % | 99,9 % | +0,5 Pp. | 99 % / 93 % | |
| Gemini 3.5 Flash Lite | 99,2 % | 99,6 % | +0,4 Pp. | 96 % / 92 % | |
| Mistral Medium 3.5 Mistral | 97,8 % | 98,1 % | +0,4 Pp. | 81 % / 79 % | |
| Mistral Medium 3.5 Mistral | 97,8 % | 98,0 % | +0,2 Pp. | 83 % / 79 % | |
| DeepSeek V4.1 Flash DeepSeek | 99,4 % | 99,6 % | +0,2 Pp. | 95 % / 93 % | |
| Claude Sonnet 5 Anthropic | 99,8 % | 100,0 % | +0,2 Pp. | 100 % / 99 % | |
| Gemini 3.5 Flash Lite | 99,2 % | 99,4 % | +0,2 Pp. | 93 % / 92 % | |
| Gemini 3.8 Flash | 99,8 % | 99,9 % | +0,1 Pp. | 99 % / 98 % | |
| Gemini 3.8 Flash | 99,8 % | 99,9 % | +0,1 Pp. | 99 % / 98 % | |
| DeepSeek V4.1 Flash DeepSeek | 99,4 % | 99,4 % | −0,0 Pp. | 93 % / 93 % | |
| GPT-6 Sol OpenAI | 99,9 % | 99,9 % | −0,0 Pp. | 99 % / 99 % | |
| GPT-6 Sol OpenAI | 99,9 % | 99,9 % | −0,0 Pp. | 99 % / 99 % | |
| GPT-6 Sol OpenAI | 99,9 % | 99,9 % | −0,1 Pp. | 99 % / 99 % | |
| Mistral Medium 3.5 Mistral | 97,8 % | 97,6 % | −0,1 Pp. | 75 % / 79 % | |
| Mistral Small 4 Mistral | 95,6 % | 95,4 % | −0,2 Pp. | 56 % / 58 % | |
| Mistral Small 4 Mistral | 95,6 % | 95,2 % | −0,4 Pp. | 65 % / 58 % | |
| GPT-6 Luna OpenAI | 99,7 % | 99,3 % | −0,4 Pp. | 94 % / 97 % | |
| GPT-6 Luna OpenAI | 99,7 % | 99,2 % | −0,5 Pp. | 91 % / 97 % | |
| Gemini 3.5 Flash Lite | 99,2 % | 98,6 % | −0,6 Pp. | 85 % / 92 % | |
| GPT-6 Luna OpenAI | 99,7 % | 98,9 % | −0,8 Pp. | 88 % / 97 % | |
| GPT-6 Luna OpenAI | 99,7 % | 98,9 % | −0,8 Pp. | 88 % / 97 % | |
| GPT-6 Sol OpenAI | 99,9 % | 99,0 % | −0,9 Pp. | 89 % / 99 % | |
| Claude Sonnet 5 Anthropic | 99,8 % | 98,8 % | −1,0 Pp. | 87 % / 99 % | |
| Mistral Small 4 Mistral | 95,6 % | 94,5 % | −1,1 Pp. | 53 % / 58 % | |
| Claude Sonnet 5 Anthropic | 99,8 % | 98,6 % | −1,2 Pp. | 96 % / 99 % | |
| DeepSeek V4.1 Flash DeepSeek | 99,4 % | 98,0 % | −1,3 Pp. | 78 % / 93 % | |
| Gemma 4 31B | 97,6 % | 96,1 % | −1,5 Pp. | 67 % / 81 % | |
| Gemma 4 31B | 97,6 % | 95,2 % | −2,4 Pp. | 67 % / 81 % | |
| Gemini 3.8 Flash | 99,8 % | 97,3 % | −2,5 Pp. | 97 % / 98 % | |
| Mistral Medium 3.5 Mistral | 97,8 % | 94,9 % | −2,9 Pp. | 67 % / 79 % | |
| Gemma 4 31B | 97,6 % | 94,7 % | −3,0 Pp. | 54 % / 81 % | |
| Gemini 3.8 Flash | 99,8 % | 95,9 % | −3,9 Pp. | 95 % / 98 % | |
| Gemma 4 31B | 97,6 % | 93,3 % | −4,3 Pp. | 52 % / 81 % | |
| Claude Sonnet 5 Anthropic | 99,8 % | 93,4 % | −6,5 Pp. | 77 % / 99 % |
Verglichen werden nur Felder, die in beiden Versionen des Dokuments vorkommen (Lieferant, Lieferanten-ID (EIN, IČO…), Rechnungsnummer, Zahlungsreferenz, Rechnungsdatum, Fälligkeitsdatum, Netto nach Steuersatz, Steuer nach Steuersatz, Gesamtbetrag, Währung, Bankverbindung). US-Rechnungen haben keine USt-IdNr. und kein Leistungsdatum, daher entfallen diese Felder.