Benchmark · June 2026
Wir haben 4,900 echte UI-Strings durch Polyglot in 49 Sprachen, die 9 Sprachfamilien, und ließen dann unabhängige Frontier-Modell-Bewerter jede einzelne Übersetzung bewerten. Der Datensatz, die Bewerter-Prompts und alle Rohwerte sind öffentlich.
Gesamtqualität
unabhängig bewertet
Platzhalter beibehalten
keine Laufzeitfehler
Als fehlerfrei bewertet
Bestnoten in jeder Dimension
Übereinstimmung der Bewerter
drei unabhängige Bewerter
Was das bedeutet:94.5% der Übersetzungen wurden in jeder Dimension als fehlerfrei bewertet, 99.1% benötigten höchstens kleinere stilistische Anpassungen, und 100% haben jeden Code-Platzhalter exakt beibehalten.
Bewertet mit 1–5 pro String von DeepSeek-V4-Pro, dann unabhängig von zwei weiteren Frontier-Bewertern neu bewertet. Jede Sprache erreicht 4,81 oder mehr; die Streuung zwischen der besten und der schwächsten beträgt nur 0,19.
Jede Übersetzung wurde von DeepSeek-V4-Pro bewertet und anschließend unabhängig davon von Grund auf neu durch Kimi-K2.6 und GLM-5.2 bewertet – drei Bewerter aus anderen Modellfamilien als unsere Engine, sodass kein Modell seine eigenen Verwandten bewertet. Über alle 49 Sprachen hinweg stimmten die drei innerhalb eines mittleren Deltas von 0.04 überein.
Wir verschleiern die Streuung nicht. Vier Sprachen liegen unter 4,9 – Hindi, Dänisch, Bulgarisch, Finnisch – direkt dort in der sprachspezifischen Tabelle oben. Und dort, wo die drei Bewerter am stärksten voneinander abweichen (GLM-5.2 und die anderen weichen bei einer Handvoll ressourcenarmer Sprachen um einige Zehntel ab), veröffentlichen wir das ebenfalls. Benchmarks, die ihre Ausreißer zeigen, sind diejenigen, denen man vertrauen kann.
100 UI-Strings in 12 Kategorien – Schaltflächen, Fehlermeldungen, Pluralformen und interpolierte Variablen wie {name} – übersetzt durch exakt dieselbe Pipeline, die auch für das Produkt verwendet wird. Keine spezielle Benchmark-Konfiguration.
Der Datensatz, die wortgetreuen Bewertungs-Prompts und jede Übersetzung mitsamt ihrer Bewertungen pro String sind Open Source. Bewerten Sie unsere Ergebnisse mit einem beliebigen LLM neu – einschließlich solcher, die wir nicht verwendet haben – und vergleichen Sie sie mit den veröffentlichten Zahlen.
An Ihren Strings ansehen
Ihre ersten 50 Übersetzungen sind kostenlos – kein Konto erforderlich. Führen Sie einen Scan durch und bewerten Sie die Ergebnisse selbst.
Loslegen