TranslationBench 1.0 · Englisch → Deutsch · 12. September 2026
Der Härtetest für KI-Übersetzungen: 12 Texte, 23 Fassungen, unabhängig bewertet.
Zehn führende KI-Modelle übersetzten zwölf anspruchsvolle englische Texte jeweils zweimal: einmal innerhalb von ProsaBridge und einmal bei direkter Nutzung. DeepL, Google Translate und Amazon Translate übersetzten dieselben Texte. Zwei unabhängige KI-Prüfer verglichen anschließend jede Übersetzung anhand von MQM-Kategorien mit dem Original und erfassten jeden Fehler. GPT-6 Astra innerhalb von ProsaBridge erzielte das verlässlichste Ergebnis mit dem niedrigsten Fehlerwert: 43 % weniger Fehler als dasselbe Modell allein; der Fehlerwert von DeepL lag 20× höher. Bei 8 von 10 Modellen senkte ProsaBridge die Fehlerrate.
- Verglichene Übersetzungen
- 23 · 10 KI-Modelle, je zweimal, plus 3 Dienste
- Texte
- 12 · 5.479 Wörter insgesamt
- Prüfer
- Zwei unabhängige KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra
- Richtung
- Englisch → Deutsch
Die kurzen Antworten
- Besser, als das KI-Modell direkt zu nutzen?
- −59 %
- Weniger Fehlerpunkte bei einem Fachbuch mit 67.127 Wörtern im Vergleich zum selben KI-Modell bei direkter Nutzung. Bei den zwölf kurzen Texten verursachte das beste Modell mit ProsaBridge 43 % weniger Fehlerpunkte als allein.
- Besser als DeepL und Google Translate?
- 20×
- Der Fehlerwert von DeepL lag bei denselben zwölf Texten 20× über dem der besten ProsaBridge-Fassung, der von Google Translate 49× darüber. Amazon Translate belegte den letzten Platz.
- Lässt sich das nachprüfen?
- Ja
- Zwei unabhängige KI-Prüfer bewerteten jede Übersetzung blind anhand von MQM-Kategorien. Beide Einzelwerte sind für jede Fassung vollständig offengelegt. Sämtliche Rohdaten und Auswertungen stehen zur Prüfung bereit.
So lesen Sie diese Seite
Eine Fassung ist ein KI-Modell in einer der beiden Arbeitsweisen oder ein Übersetzungsdienst. Es gibt 23 Fassungen.
- Mit ProsaBridge
- Das KI-Modell arbeitet innerhalb von ProsaBridge. Es liest zuerst den ganzen Text, plant die Übersetzung und übersetzt dann nach diesem Plan.
- Modell allein
- Dasselbe KI-Modell erhält den Text einmal und übersetzt ihn in einem einzigen Schritt.
- Übersetzungsdienst
- DeepL, Google Translate oder Amazon Translate, jeweils mit ihrem Dienst für ganze Dokumente.
- Fehlerwert
- Jeder Prüfer ordnet die gefundenen Fehler den Kategorien von MQM (Multidimensional Quality Metrics) zu. In diesem Benchmark zählt ein kleiner Ausrutscher 1 Punkt, ein schwerer Fehler 5 und ein kritischer Fehler 10 Punkte. Der Fehlerwert ist die Summe der Strafpunkte pro 100 Wörter, gemittelt über beide Prüfer und alle zwölf Texte. Ein niedrigerer Wert bedeutet höhere Qualität.
- Ein Wert von 1,0 bedeutet etwa einen kleinen Ausrutscher alle 100 Wörter. Der beste Wert hier, 0,14, bedeutet etwa einen kleinen Ausrutscher alle 700 Wörter.
- Genauigkeit
- Die Übersetzung weicht inhaltlich vom Original ab: verfälschte Fakten, unzutreffende Fachbegriffe oder ausgelassene Sätze.
- Lesbarkeit
- Die Übersetzung gibt den Inhalt zwar wieder, ist aber sprachlich mangelhaft: holprige Formulierungen, Grammatikfehler oder unpassender Tonfall.
Abb. 1
Gesamtrangliste: Gemessene Fehlerwerte aller 23 Fassungen
Alle 23 Fassungen auf einer Skala, die beste zuerst. Der Balken ist der Fehlerwert; die Skala reicht bis zum schlechtesten Wert; der Abstand zwischen den KI-Fassungen und den drei Übersetzungsdiensten ist also maßstabsgetreu. GPT-6 Astra innerhalb von ProsaBridge führt mit 0,14.
| Rang | Fassung | Fehlerwert | Fehlerwert |
|---|---|---|---|
| 1 | GPT-6 AstraMit ProsaBridge | 0,14 | |
| 2 | GPT-5.6 SolMit ProsaBridge | 0,25 | |
| 3 | GPT-6 AstraModell allein | 0,25 | |
| 4 | GPT-6 AstraMit ProsaBridge | 0,25 | |
| 5 | GPT-5.6 SolModell allein | 0,40 | |
| 6 | GPT-6 AstraModell allein | 0,44 | |
| 7 | Fable 5.1Modell allein | 0,45 | |
| 8 | Fable 5.1Mit ProsaBridge | 0,48 | |
| 9 | Gemini 3.8 FlashMit ProsaBridge | 0,51 | |
| 10 | GPT-5.6 LunaMit ProsaBridge | 0,66 | |
| 11 | Opus 5Mit ProsaBridge | 0,70 | |
| 12 | Fable 5.1Modell allein | 0,81 | |
| 13 | Gemini 3.8 FlashModell allein | 0,82 | |
| 14 | Fable 5.1Mit ProsaBridge | 0,83 | |
| 15 | GPT-5.6 LunaModell allein | 1,00 | |
| 16 | Grok 4.6Mit ProsaBridge | 1,33 | |
| 17 | GLM-5.3 FlashMit ProsaBridge | 1,46 | |
| 18 | GLM-5.3 FlashModell allein | 1,65 | |
| 19 | Opus 5Modell allein | 1,83 | |
| 20 | Grok 4.6Modell allein | 2,57 | |
| 21 | DeepLÜbersetzungsdienst · 20× so viele Fehlerpunkte wie die beste Fassung | 2,88 | |
| 22 | GoogleÜbersetzungsdienst · 49× so viele Fehlerpunkte wie die beste Fassung | 7,13 | |
| 23 | AmazonÜbersetzungsdienst · 110× so viele Fehlerpunkte wie die beste Fassung | 15,93 | |
›Alle 23 Fassungen mit allen Zahlen anzeigen
Eine Zeile pro Fassung mit ihrem Fehlerwert, den Anteilen Genauigkeit und Lesbarkeit, dem Wert jedes Prüfers und ihren Kosten aus Abb. 3. Klicken Sie auf eine Spalte, um danach zu sortieren. Zwei der teilnehmenden KI-Modelle sind zugleich die Prüfer; diese Fassungen tragen eine Markierung. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.
Spalte anklicken zum Sortieren · sortiert nach Wert
| Rang | Fassung | Fehlerwert | Bestes Verhältnis | ||||||
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra†Mit ProsaBridge · high/xhigh/xhigh | 0,14 | 0,06 | 0,08 | 0,27 | 0,02 | 501,9× | ◆ | |
| 2 | GPT-5.6 SolMit ProsaBridge · high/xhigh/xhigh | 0,25 | 0,07 | 0,18 | 0,34 | 0,16 | 158,9× | ◆ | |
| 3 | GPT-6 Astra†Modell allein · xhigh | 0,25 | 0,14 | 0,11 | 0,31 | 0,20 | 184,2× | ||
| 4 | GPT-6 Astra†Mit ProsaBridge · medium/medium/medium | 0,25 | 0,09 | 0,16 | 0,42 | 0,09 | 109,5× | ◆ | |
| 5 | GPT-5.6 SolModell allein · xhigh | 0,40 | 0,20 | 0,21 | 0,47 | 0,34 | 84,9× | ◆ | |
| 6 | GPT-6 Astra†Modell allein · medium | 0,44 | 0,12 | 0,32 | 0,61 | 0,27 | 21,4× | ◆ | |
| 7 | Fable 5.1†Modell allein · xhigh | 0,45 | 0,18 | 0,27 | 0,33 | 0,58 | 96,6× | ||
| 8 | Fable 5.1†Mit ProsaBridge · high/xhigh/xhigh | 0,48 | 0,23 | 0,25 | 0,29 | 0,67 | 354,4× | ||
| 9 | Gemini 3.8 FlashMit ProsaBridge · high/xhigh/xhigh | 0,51 | 0,19 | 0,32 | 0,54 | 0,47 | 47,5× | ||
| 10 | GPT-5.6 LunaMit ProsaBridge · medium/xhigh/xhigh | 0,66 | 0,31 | 0,35 | 0,77 | 0,56 | 10,9× | ◆ | |
| 11 | Opus 5Mit ProsaBridge · high/xhigh/xhigh | 0,70 | 0,29 | 0,41 | 0,48 | 0,92 | 174,6× | ||
| 12 | Fable 5.1†Modell allein · medium | 0,81 | 0,28 | 0,53 | 0,77 | 0,85 | 45,1× | ||
| 13 | Gemini 3.8 FlashModell allein · xhigh | 0,82 | 0,41 | 0,41 | 0,78 | 0,85 | 17,6× | ||
| 14 | Fable 5.1†Mit ProsaBridge · medium/medium/medium | 0,83 | 0,41 | 0,42 | 0,64 | 1,02 | 169,1× | ||
| 15 | GPT-5.6 LunaModell allein · xhigh | 1,00 | 0,53 | 0,47 | 0,92 | 1,08 | 4,2× | ◆ | |
| 16 | Grok 4.6Mit ProsaBridge · high/xhigh/xhigh | 1,33 | 0,42 | 0,91 | 0,99 | 1,67 | 101× | ||
| 17 | GLM-5.3 FlashMit ProsaBridge · xhigh/xhigh/xhigh | 1,46 | 0,60 | 0,85 | 1,59 | 1,32 | 9,5× | ||
| 18 | GLM-5.3 FlashModell allein · xhigh | 1,65 | 0,66 | 0,99 | 1,57 | 1,73 | 1× | ◆ | |
| 19 | Opus 5Modell allein · xhigh | 1,83 | 1,07 | 0,76 | 1,68 | 1,99 | 17,6× | ||
| 20 | Grok 4.6Modell allein · xhigh | 2,57 | 1,01 | 1,57 | 2,51 | 2,64 | 15,2× | ||
| 21 | DeepLÜbersetzungsdienst | 2,88 | 1,90 | 0,98 | 2,60 | 3,16 | – | ||
| 22 | GoogleÜbersetzungsdienst | 7,13 | 5,98 | 1,15 | 6,30 | 7,96 | – | ||
| 23 | AmazonÜbersetzungsdienst | 15,93 | 12,60 | 3,33 | 14,42 | 17,44 | – |
Die Balken teilen sich eine Achse, die bei 3,00 endet. Längere Balken sind abgeschnitten und schraffiert; die Zahlen stehen vollständig daneben. ◆ Bestes Verhältnis: Keine andere Fassung ist zugleich günstiger und besser. Diese Fassungen bilden die Grenze in Abb. 3. † Bei dieser Fassung wurde dasselbe KI-Modell verwendet wie bei einem der Prüfer. Der veröffentlichte Wert stützt sich auf beide Prüfer.
Abb. 2
Härtetest auf voller Buchlänge: 67.127 Wörter im direkten Vergleich
−59 %
weniger Fehlerpunkte innerhalb von ProsaBridge als bei direkter Nutzung desselben Modells: 0,08 gegenüber 0,20. 98 % des Qualitätsvorsprungs entfallen auf die Genauigkeit; die Lesbarkeitswerte sind fast gleich.
Ein Buch · 61 Abschnitte · 67.127 Wörter · Deutsch → Englisch · zwei Prüfer · Text nicht öffentlich
Ein wissenschaftliches Buch mit 67.127 Wörtern in 61 Abschnitten wurde zweimal vom selben KI-Modell aus dem Deutschen ins Englische übersetzt, und zwar von GPT-6 Astra mit sehr hoher Denkintensität. Einmal innerhalb von ProsaBridge. Einmal direkt mit dem gesamten Buch und der Anweisung, wie ein englischsprachiges Original zu klingen. Beide Prüfer verglichen anschließend jeden Abschnitt blind mit dem deutschen Ausgangstext, ohne das Glossar und die Vorbereitung von ProsaBridge zu kennen.
| Fassung | Fehlerwert | Wert | Genauigkeit | Lesbarkeit | Fable 5.1 medium | GPT-6 Astra medium |
|---|---|---|---|---|---|---|
| GPT-6 Astra innerhalb von ProsaBridge | 0,08 | 0,06 | 0,02 | 0,12 | 0,04 | |
| GPT-6 Astra direkt genutzt | 0,20 | 0,18 | 0,02 | 0,28 | 0,12 | |
GenauigkeitLesbarkeit
Abb. 3
Kosten-Nutzen-Verhältnis: Rechenaufwand vs. Qualität
Weniger Fehler kosten meist mehr Rechenleistung. Weiter oben ist besser und weiter rechts ist günstiger; das beste Verhältnis liegt also oben rechts. Die Kosten sind ein Vielfaches der günstigsten Fassung, GLM-5.3 Flash allein, und die Achse ist logarithmisch: Gleiche Abstände sind gleiche Verhältnisse. Eine Linie verbindet die beiden Fassungen desselben Modells. Die schattierte Treppe ist die Grenze des besten Verhältnisses: Keine Fassung innerhalb der Treppe ist zugleich günstiger und besser als eine auf der Kante.
- Mit ProsaBridge
- Modell allein
- Übersetzungsdienst
- Grenze des besten Verhältnisses
Grenze des besten Verhältnisses
- GLM-5.3 FlashModell allein1× · 1,65
- GPT-5.6 LunaModell allein4,2× · 1,00
- GPT-5.6 LunaMit ProsaBridge10,9× · 0,66
- GPT-6 AstraModell allein21,4× · 0,44
- GPT-5.6 SolModell allein84,9× · 0,40
- GPT-6 AstraMit ProsaBridge109,5× · 0,25
- GPT-5.6 SolMit ProsaBridge158,9× · 0,25
- GPT-6 AstraMit ProsaBridge501,9× · 0,14
So entsteht der Fehlerwert
Zwei KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra, lesen jede Übersetzung Seite an Seite mit ihrem Original. Sie wissen nicht, welche Fassung sie vor sich haben, und sehen die Arbeit des anderen nicht. Jeder Prüfer markiert jeden Fehler mit einer Kategorie, einem Gewicht und einer Begründung. Die Kategorien folgen MQM (Multidimensional Quality Metrics), einem Rahmen zur Bewertung von Übersetzungsqualität.
Ein leichter Fehler zählt 1 Punkt, ein schwerer Fehler 5 Punkte, ein kritischer Fehler 10 Punkte. Die Strafpunkte einer Übersetzung werden addiert, durch ihre Wortzahl geteilt und auf 100 Wörter umgerechnet. Der Wert einer Fassung für einen Text ist der Mittelwert der beiden Prüfer; ihr veröffentlichter Wert ist der Mittelwert über die zwölf Texte.
Innerhalb von ProsaBridge durchläuft ein Modell dieselben Schritte wie bei einem Kundendokument: Es liest den ganzen Text, erstellt einen Übersetzungsplan und übersetzt danach. Allein erhält dasselbe Modell nur den Text und das Ausgabeformat. Keiner der beiden Abläufe wurde für diesen Benchmark verändert.
›So haben wir die Rangfolge geprüft
Die Abstände, auf die es ankommt, sind bestätigt: die drei Übersetzungsdienste am Ende, jedes Paar von der letzten KI-Fassung bis hinunter zu Amazon Translate, und 10 der 22 Nachbarpaare in ihrer veröffentlichten Reihenfolge. Die vorderen Fassungen liegen dicht beieinander; lesen Sie die ersten Plätze deshalb als Gruppe.
Nach dem Festlegen der Rangliste haben beide Prüfer jede Fassung mit der direkt darunter platzierten verglichen, Text für Text, ohne zu wissen, welche welche ist. Ein Text zählt nur dann für eine der beiden Fassungen, wenn beide Prüfer übereinstimmen.
- 1GPT-6 Astra, Mit ProsaBridgevs.2GPT-5.6 Sol, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 2GPT-5.6 Sol, Mit ProsaBridgevs.3GPT-6 Astra, Modell allein2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 3GPT-6 Astra, Modell alleinvs.4GPT-6 Astra, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer keinen Unterschied sahen, 8 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 4GPT-6 Astra, Mit ProsaBridgevs.5GPT-5.6 Sol, Modell allein5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 5GPT-5.6 Sol, Modell alleinvs.6GPT-6 Astra, Modell allein2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 6GPT-6 Astra, Modell alleinvs.7Fable 5.1, Modell allein4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 8 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 7Fable 5.1, Modell alleinvs.8Fable 5.1, Mit ProsaBridge3 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenPrüfer bevorzugten die niedriger platzierte Fassung
- 8Fable 5.1, Mit ProsaBridgevs.9Gemini 3.8 Flash, Mit ProsaBridge2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 9Gemini 3.8 Flash, Mit ProsaBridgevs.10GPT-5.6 Luna, Mit ProsaBridge2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 9 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 10GPT-5.6 Luna, Mit ProsaBridgevs.11Opus 5, Mit ProsaBridge1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 10 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 11Opus 5, Mit ProsaBridgevs.12Fable 5.1, Modell allein6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 4 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 12Fable 5.1, Modell alleinvs.13Gemini 3.8 Flash, Modell allein1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenPrüfer bevorzugten die niedriger platzierte Fassung
- 13Gemini 3.8 Flash, Modell alleinvs.14Fable 5.1, Mit ProsaBridge5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 14Fable 5.1, Mit ProsaBridgevs.15GPT-5.6 Luna, Modell allein4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig warenZu knapp für ein Urteil
- 15GPT-5.6 Luna, Modell alleinvs.16Grok 4.6, Mit ProsaBridge9 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 16Grok 4.6, Mit ProsaBridgevs.17GLM-5.3 Flash, Mit ProsaBridge4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 17GLM-5.3 Flash, Mit ProsaBridgevs.18GLM-5.3 Flash, Modell allein6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 18GLM-5.3 Flash, Modell alleinvs.19Opus 5, Modell allein5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 5 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenAusgeglichen
- 19Opus 5, Modell alleinvs.20Grok 4.6, Modell allein8 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 20Grok 4.6, Modell alleinvs.21DeepL, Übersetzungsdienst5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 21DeepL, Übersetzungsdienstvs.22Google, Übersetzungsdienst11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- 22Google, Übersetzungsdienstvs.23Amazon, Übersetzungsdienst11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig warenReihenfolge bestätigt
- Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten
- Texte, bei denen beide Prüfer keinen Unterschied sahen
- Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten
- Texte, bei denen die Prüfer uneinig waren
Grok 4.6 allein und DeepL liegen zu dicht beieinander, um sie zu trennen. Werte, die wenige Hundertstel auseinanderliegen, können an einem anderen Tag die Plätze tauschen; der Download enthält jedes Paar.
Was diese Seite nicht sagt
- Nur Englisch nach Deutsch. Andere Sprachpaare bekommen eigene Ergebnisse.
- Zwölf Texte mit 300 bis 500 Wörtern. ProsaBridge ist für ganze Bücher und Berichte ausgelegt, in denen Namen, Begriffe und Stil über Hunderte von Seiten hinweg gleich bleiben müssen. Kurze Texte zeigen nur einen Teil dieses Unterschieds: Beim ganzen Buch in Abb. 2 war der Abstand zum selben Modell größer als bei den zwölf Texten.
- Ein einzelner Durchgang. Die Zahlen sind keine Mittelwerte über wiederholte Durchgänge. Unterschiede von wenigen Hundertstelpunkten können Zufallsschwankungen sein.
- Die Prüfer sind KI-Modelle, und zwei der teilnehmenden Modelle sind zugleich die Prüfer. Ihre getrennten Werte sind sichtbar, damit Sie das selbst prüfen können. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.
Was wir nicht veröffentlichen
- Die zwölf Texte. Sie wurden für diesen Benchmark geschrieben und nie veröffentlicht; kein KI-Modell hat sie oder eine Übersetzung davon gesehen. Eine Veröffentlichung brächte sie in die nächsten Trainingsdaten und machte jeden späteren Durchgang unbrauchbar. Titel, Textsorte, Länge und Schwierigkeit stehen weiter unten.
- Die Anweisungen, die ProsaBridge den Modellen gibt, und die Anweisungen, denen die Prüfer folgen.
- Was die Durchgänge gekostet haben. Das Kostendiagramm zeigt nur Vielfache der günstigsten Fassung.
- Die Notizen der Prüfer und die Übersetzungen selbst, weil sie die Texte offenlegen würden.
Die zwölf Texte
Sieben Kurzgeschichten und fünf Sachtexte, jeder so geschrieben, dass er auf eine bestimmte Art schwer zu übersetzen ist.
| Text | Art | Wörter | Was ihn schwer macht | |
|---|---|---|---|---|
| 1 | The Lease | Erzählung, Dialog | 431 | Wechsel von Sie zu du, Dialog, trockener Humor |
| 2 | Gravel | Erzählung, Innensicht | 485 | Gedanken in erlebter Rede, umgangssprachliche Einschübe, unmarkierte Fragen |
| 3 | The Orchard Ledger | Erzählung, lyrisch | 463 | Eine lange Metapher, die von Anfang bis Ende tragen muss |
| 4 | Southpaw | Erzählung, Szene | 449 | Kurze, harte Sätze neben einem einzigen langen |
| 5 | The Committee | Erzählung, Satire | 446 | Lange Schachtelsätze, Einschübe, Ironie, die von der Wortstellung abhängt |
| 6 | Moving the Needle | Erzählung, Arbeitswelt | 462 | Viele Redewendungen und ein Wortspiel, von dem der ganze Text abhängt |
| 7 | The Visitor | Erzählung, Innensicht | 458 | Ein absichtlich unklares „sie“, das unklar bleiben muss |
| 8 | Remarks at the Dedication of the Cedar Run Flood Memorial | Sachtext, Rede | 441 | Amerikanischer Festredeton, Wiederholung als Stilmittel, Namen von Institutionen |
| 9 | Allision of the Ferry Marguerite Bay at Harbor Point Terminal | Sachtext, Unfallbericht | 478 | Nautische Begriffe, Passiv, exakte Zeiten und Maße |
| 10 | The Sleep of Swifts | Sachtext, Populärwissenschaft | 493 | Lyrisches Wissenschaftsschreiben zwischen Daten und Bildern |
| 11 | Expanding District Heating in Mid-Sized Cities | Sachtext, Politikpapier | 436 | „Sollte“, „muss“ und „kann“, die ihre genaue Stärke behalten müssen; falsche Freunde; gleichbleibende Begriffe |
| 12 | Midterm Evaluation of the Aldercreek Adult Literacy Program | Sachtext, Evaluationsbericht | 437 | Begriffspaare, die getrennt bleiben müssen, vorsichtige Zuschreibungen, abgewogene Empfehlungen |
Vor der Veröffentlichung entfernte Modelle
Diese Modelle haben während der Entwicklung teilgenommen und fehlen in den veröffentlichten Ergebnissen. Jede Entfernung ist mit ihren Belegen dokumentiert.
- Claude Sonnet 5
- Nach sieben Texten wegen schwacher Übersetzungsqualität entfernt: 3,18 und 3,22 Fehlerpunkte pro 100 Wörter, hinter jedem anderen KI-Modell zu dieser Zeit.
- Kimi K2 Thinking
- Entfernt, weil es bei drei der sieben Texte das Ausgabelimit des Anbieters erreichte, ohne eine Antwort zu liefern.
- Mistral Large 3
- Entfernt, weil es eigene Dokumentformatierung hinzufügte und übersetzten Text zurückgab, wo der Ablauf feste Referenzcodes verlangt.
- Gemini 3.1 Pro und GPT-5.6 Terra
- Vor dem veröffentlichten Durchgang zurückgezogen: Für ihren Preis waren ihre Werte zu schwach. Günstigere Modelle erreichten bessere Werte, und bessere Modelle kosteten etwa dasselbe. Ihre früheren Ergebnisse sind archiviert.
Daten herunterladen
Der Benchmark-Durchgang: jede Fassung jedes Texts, wie jeder Prüfer sie bewertet hat, die Fehlerzahlen nach Gewicht und Art, die Kosten als Vielfache und die Nachbarvergleiche.
Datensatz 1.0 herunterladenDie Buchstudie: die Werte beider Übersetzungen insgesamt, nach Fehlerart und je Prüfer, dazu der Umfang des Buchs. Kein Text aus dem Buch.
Datensatz zum Buch herunterladen- Durchgang
- translationbench-run-fa35fa02-3190-4f82-b379-8d05b7dde5d7
- Version
- 1.0 (7.2)
- Abgeschlossen
- 12. September 2026