Benchmark · June 2026

4.96/5 Übersetzungsqualität. Unabhängig bewertet. Vollständig reproduzierbar.

Wir haben 4,900 echte UI-Strings durch Polyglot in 49 Sprachen, die 9 Sprachfamilien, und ließen dann unabhängige Frontier-Modell-Bewerter jede einzelne Übersetzung bewerten. Der Datensatz, die Bewerter-Prompts und alle Rohwerte sind öffentlich.

[01]Die Überschrift
4.96/5

Gesamtqualität

unabhängig bewertet

100%

Platzhalter beibehalten

keine Laufzeitfehler

94.5%

Als fehlerfrei bewertet

Bestnoten in jeder Dimension

±0.04

Übereinstimmung der Bewerter

drei unabhängige Bewerter

Was das bedeutet:94.5% der Übersetzungen wurden in jeder Dimension als fehlerfrei bewertet, 99.1% benötigten höchstens kleinere stilistische Anpassungen, und 100% haben jeden Code-Platzhalter exakt beibehalten.

Bewertungsverteilung pro String · 4.900 Strings
5 · makellos
94.5%
4
4.6%
3
0.8%
≤2
0.1%
[02]Jede Punktzahl

Jede Sprache, jede Dimension.

Bewertet mit 1–5 pro String von DeepSeek-V4-Pro, dann unabhängig von zwei weiteren Frontier-Bewertern neu bewertet. Jede Sprache erreicht 4,81 oder mehr; die Streuung zwischen der besten und der schwächsten beträgt nur 0,19.

Gesamtpunktzahl · alle 49 Sprachen Streuung 0.19
4.64.74.84.95.0
Germanic
SpracheGenFlussVarianzGesamt
Afrikaans4.974.975.004.98
Danish4.814.785.004.86
German4.944.955.004.96
Icelandic4.974.975.004.98
Norwegian Bokmål4.984.995.004.99
Dutch4.984.945.004.97
Swedish4.934.935.004.95
Romance
SpracheGenFlussVarianzGesamt
Catalan5.005.005.005.00
Spanish4.974.985.004.98
French4.934.935.004.95
Italian4.944.945.004.96
Portuguese4.994.995.004.99
Portuguese (Brazil)4.984.995.004.99
Romanian4.964.975.004.98
Slavic
SpracheGenFlussVarianzGesamt
Bulgarian4.834.795.004.87
Czech4.934.815.004.91
Croatian4.974.955.004.97
Polish4.954.905.004.95
Russian4.944.915.004.95
Slovak4.904.895.004.93
Slovenian4.974.965.004.98
Serbian5.004.995.005.00
Ukrainian4.954.955.004.97
Baltic, Finnic & Hellenic
SpracheGenFlussVarianzGesamt
Greek4.974.925.004.96
Estonian4.974.975.004.98
Finnish4.834.785.004.87
Hungarian4.964.935.004.96
Lithuanian5.005.005.005.00
Latvian4.954.955.004.97
East Asian
SpracheGenFlussVarianzGesamt
Japanese4.984.985.004.99
Korean4.984.985.004.99
Chinese (Simplified)5.005.005.005.00
Chinese (Traditional)5.005.005.005.00
South Asian
SpracheGenFlussVarianzGesamt
Bengali5.004.985.004.99
Hindi4.814.635.004.81
Marathi4.894.885.004.92
Tamil4.984.975.004.98
Telugu4.984.945.004.97
Urdu4.934.905.004.94
Middle Eastern
SpracheGenFlussVarianzGesamt
Arabic4.984.985.004.99
Persian4.934.915.004.95
Hebrew4.874.875.004.91
Southeast Asian
SpracheGenFlussVarianzGesamt
Indonesian5.005.005.005.00
Malay4.954.955.004.97
Thai4.994.995.004.99
Tagalog5.004.945.004.98
Vietnamese5.005.005.005.00
Turkic & African
SpracheGenFlussVarianzGesamt
Turkish4.974.965.004.98
Swahili4.994.995.004.99
[03]Methodik

Entwickelt, um hinterfragt zu werden.

Unabhängige Juroren, rivalisierende Familien

Jede Übersetzung wurde von DeepSeek-V4-Pro bewertet und anschließend unabhängig davon von Grund auf neu durch Kimi-K2.6 und GLM-5.2 bewertet – drei Bewerter aus anderen Modellfamilien als unsere Engine, sodass kein Modell seine eigenen Verwandten bewertet. Über alle 49 Sprachen hinweg stimmten die drei innerhalb eines mittleren Deltas von 0.04 überein.

Wir veröffentlichen die Meinungsverschiedenheiten

Wir verschleiern die Streuung nicht. Vier Sprachen liegen unter 4,9 – Hindi, Dänisch, Bulgarisch, Finnisch – direkt dort in der sprachspezifischen Tabelle oben. Und dort, wo die drei Bewerter am stärksten voneinander abweichen (GLM-5.2 und die anderen weichen bei einer Handvoll ressourcenarmer Sprachen um einige Zehntel ab), veröffentlichen wir das ebenfalls. Benchmarks, die ihre Ausreißer zeigen, sind diejenigen, denen man vertrauen kann.

Echte Strings, Produktions-Pipeline

100 UI-Strings in 12 Kategorien – Schaltflächen, Fehlermeldungen, Pluralformen und interpolierte Variablen wie {name} – übersetzt durch exakt dieselbe Pipeline, die auch für das Produkt verwendet wird. Keine spezielle Benchmark-Konfiguration.

[04]Reproduzieren

Glauben Sie uns nicht aufs Wort.

Der Datensatz, die wortgetreuen Bewertungs-Prompts und jede Übersetzung mitsamt ihrer Bewertungen pro String sind Open Source. Bewerten Sie unsere Ergebnisse mit einem beliebigen LLM neu – einschließlich solcher, die wir nicht verwendet haben – und vergleichen Sie sie mit den veröffentlichten Zahlen.

$ export JUDGE_API_KEY=...
$ python3 rejudge.py results/de.json \
--model your-favorite-judge \
--endpoint https://your-provider/v1/chat/completions
Dimension Veröffentlicht Ihr Judge Delta
────────────────────────────────────────────
Genauigkeit 4,94 4,95 +0,01
Flüssigkeit 4,95 4,96 +0,01
Variablen 5.00 5.00 +0.00

An Ihren Strings ansehen

Qualität, die Sie selbst überprüfen können.

Ihre ersten 50 Übersetzungen sind kostenlos – kein Konto erforderlich. Führen Sie einen Scan durch und bewerten Sie die Ergebnisse selbst.

Loslegen
Translation Quality Benchmark — 4.96/5 across 49 languages | Polyglot