Zurück zur Startseite

TranslationBench 1.0 · Englisch → Deutsch · 12. September 2026

Der Härtetest für KI-Übersetzungen: 12 Texte, 23 Fassungen, unabhängig bewertet.

Zehn führende KI-Modelle übersetzten zwölf anspruchsvolle englische Texte jeweils zweimal: einmal innerhalb von ProsaBridge und einmal bei direkter Nutzung. DeepL, Google Translate und Amazon Translate übersetzten dieselben Texte. Zwei unabhängige KI-Prüfer verglichen anschließend jede Übersetzung anhand von MQM-Kategorien mit dem Original und erfassten jeden Fehler. GPT-6 Astra innerhalb von ProsaBridge erzielte das verlässlichste Ergebnis mit dem niedrigsten Fehlerwert: 43 % weniger Fehler als dasselbe Modell allein; der Fehlerwert von DeepL lag 20× höher. Bei 8 von 10 Modellen senkte ProsaBridge die Fehlerrate.

Verglichene Übersetzungen
23 · 10 KI-Modelle, je zweimal, plus 3 Dienste
Texte
12 · 5.479 Wörter insgesamt
Prüfer
Zwei unabhängige KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra
Richtung
Englisch → Deutsch

Die kurzen Antworten

Besser, als das KI-Modell direkt zu nutzen?
−59 %
Weniger Fehlerpunkte bei einem Fachbuch mit 67.127 Wörtern im Vergleich zum selben KI-Modell bei direkter Nutzung. Bei den zwölf kurzen Texten verursachte das beste Modell mit ProsaBridge 43 % weniger Fehlerpunkte als allein.
Besser als DeepL und Google Translate?
20×
Der Fehlerwert von DeepL lag bei denselben zwölf Texten 20× über dem der besten ProsaBridge-Fassung, der von Google Translate 49× darüber. Amazon Translate belegte den letzten Platz.
Lässt sich das nachprüfen?
Ja
Zwei unabhängige KI-Prüfer bewerteten jede Übersetzung blind anhand von MQM-Kategorien. Beide Einzelwerte sind für jede Fassung vollständig offengelegt. Sämtliche Rohdaten und Auswertungen stehen zur Prüfung bereit.

So lesen Sie diese Seite

Eine Fassung ist ein KI-Modell in einer der beiden Arbeitsweisen oder ein Übersetzungsdienst. Es gibt 23 Fassungen.

Mit ProsaBridge
Das KI-Modell arbeitet innerhalb von ProsaBridge. Es liest zuerst den ganzen Text, plant die Übersetzung und übersetzt dann nach diesem Plan.
Modell allein
Dasselbe KI-Modell erhält den Text einmal und übersetzt ihn in einem einzigen Schritt.
Übersetzungsdienst
DeepL, Google Translate oder Amazon Translate, jeweils mit ihrem Dienst für ganze Dokumente.
Fehlerwert
Jeder Prüfer ordnet die gefundenen Fehler den Kategorien von MQM (Multidimensional Quality Metrics) zu. In diesem Benchmark zählt ein kleiner Ausrutscher 1 Punkt, ein schwerer Fehler 5 und ein kritischer Fehler 10 Punkte. Der Fehlerwert ist die Summe der Strafpunkte pro 100 Wörter, gemittelt über beide Prüfer und alle zwölf Texte. Ein niedrigerer Wert bedeutet höhere Qualität.
Ein Wert von 1,0 bedeutet etwa einen kleinen Ausrutscher alle 100 Wörter. Der beste Wert hier, 0,14, bedeutet etwa einen kleinen Ausrutscher alle 700 Wörter.
Genauigkeit
Die Übersetzung weicht inhaltlich vom Original ab: verfälschte Fakten, unzutreffende Fachbegriffe oder ausgelassene Sätze.
Lesbarkeit
Die Übersetzung gibt den Inhalt zwar wieder, ist aber sprachlich mangelhaft: holprige Formulierungen, Grammatikfehler oder unpassender Tonfall.

Abb. 1

Gesamtrangliste: Gemessene Fehlerwerte aller 23 Fassungen

Alle 23 Fassungen auf einer Skala, die beste zuerst. Der Balken ist der Fehlerwert; die Skala reicht bis zum schlechtesten Wert; der Abstand zwischen den KI-Fassungen und den drei Übersetzungsdiensten ist also maßstabsgetreu. GPT-6 Astra innerhalb von ProsaBridge führt mit 0,14.

RangFassungFehlerwertFehlerwert
1GPT-6 AstraMit ProsaBridge0,14
2GPT-5.6 SolMit ProsaBridge0,25
3GPT-6 AstraModell allein0,25
4GPT-6 AstraMit ProsaBridge0,25
5GPT-5.6 SolModell allein0,40
6GPT-6 AstraModell allein0,44
7Fable 5.1Modell allein0,45
8Fable 5.1Mit ProsaBridge0,48
9Gemini 3.8 FlashMit ProsaBridge0,51
10GPT-5.6 LunaMit ProsaBridge0,66
11Opus 5Mit ProsaBridge0,70
12Fable 5.1Modell allein0,81
13Gemini 3.8 FlashModell allein0,82
14Fable 5.1Mit ProsaBridge0,83
15GPT-5.6 LunaModell allein1,00
16Grok 4.6Mit ProsaBridge1,33
17GLM-5.3 FlashMit ProsaBridge1,46
18GLM-5.3 FlashModell allein1,65
19Opus 5Modell allein1,83
20Grok 4.6Modell allein2,57
21DeepLÜbersetzungsdienst · 20× so viele Fehlerpunkte wie die beste Fassung2,88
22GoogleÜbersetzungsdienst · 49× so viele Fehlerpunkte wie die beste Fassung7,13
23AmazonÜbersetzungsdienst · 110× so viele Fehlerpunkte wie die beste Fassung15,93
Alle 23 Fassungen mit allen Zahlen anzeigen

Eine Zeile pro Fassung mit ihrem Fehlerwert, den Anteilen Genauigkeit und Lesbarkeit, dem Wert jedes Prüfers und ihren Kosten aus Abb. 3. Klicken Sie auf eine Spalte, um danach zu sortieren. Zwei der teilnehmenden KI-Modelle sind zugleich die Prüfer; diese Fassungen tragen eine Markierung. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.

Spalte anklicken zum Sortieren · sortiert nach Wert

RangFassungFehlerwertBestes Verhältnis
1GPT-6 AstraMit ProsaBridge · high/xhigh/xhigh0,140,060,080,270,02501,9×
2GPT-5.6 SolMit ProsaBridge · high/xhigh/xhigh0,250,070,180,340,16158,9×
3GPT-6 AstraModell allein · xhigh0,250,140,110,310,20184,2×
4GPT-6 AstraMit ProsaBridge · medium/medium/medium0,250,090,160,420,09109,5×
5GPT-5.6 SolModell allein · xhigh0,400,200,210,470,3484,9×
6GPT-6 AstraModell allein · medium0,440,120,320,610,2721,4×
7Fable 5.1Modell allein · xhigh0,450,180,270,330,5896,6×
8Fable 5.1Mit ProsaBridge · high/xhigh/xhigh0,480,230,250,290,67354,4×
9Gemini 3.8 FlashMit ProsaBridge · high/xhigh/xhigh0,510,190,320,540,4747,5×
10GPT-5.6 LunaMit ProsaBridge · medium/xhigh/xhigh0,660,310,350,770,5610,9×
11Opus 5Mit ProsaBridge · high/xhigh/xhigh0,700,290,410,480,92174,6×
12Fable 5.1Modell allein · medium0,810,280,530,770,8545,1×
13Gemini 3.8 FlashModell allein · xhigh0,820,410,410,780,8517,6×
14Fable 5.1Mit ProsaBridge · medium/medium/medium0,830,410,420,641,02169,1×
15GPT-5.6 LunaModell allein · xhigh1,000,530,470,921,084,2×
16Grok 4.6Mit ProsaBridge · high/xhigh/xhigh1,330,420,910,991,67101×
17GLM-5.3 FlashMit ProsaBridge · xhigh/xhigh/xhigh1,460,600,851,591,329,5×
18GLM-5.3 FlashModell allein · xhigh1,650,660,991,571,73
19Opus 5Modell allein · xhigh1,831,070,761,681,9917,6×
20Grok 4.6Modell allein · xhigh2,571,011,572,512,6415,2×
21DeepLÜbersetzungsdienst2,881,900,982,603,16
22GoogleÜbersetzungsdienst7,135,981,156,307,96
23AmazonÜbersetzungsdienst15,9312,603,3314,4217,44

Die Balken teilen sich eine Achse, die bei 3,00 endet. Längere Balken sind abgeschnitten und schraffiert; die Zahlen stehen vollständig daneben. Bestes Verhältnis: Keine andere Fassung ist zugleich günstiger und besser. Diese Fassungen bilden die Grenze in Abb. 3. † Bei dieser Fassung wurde dasselbe KI-Modell verwendet wie bei einem der Prüfer. Der veröffentlichte Wert stützt sich auf beide Prüfer.

Die KI-Fassungen liegen zwischen 0,14 und 2,57; die Dienste beginnen bei 2,88 und enden bei 15,93. Jedes KI-Modell trat zweimal an, innerhalb von ProsaBridge und allein; die vollständige Tabelle unten führt beide Fassungen mit dem Wert jedes Prüfers und den Kosten auf.

Abb. 2

Härtetest auf voller Buchlänge: 67.127 Wörter im direkten Vergleich

59 %

weniger Fehlerpunkte innerhalb von ProsaBridge als bei direkter Nutzung desselben Modells: 0,08 gegenüber 0,20. 98 % des Qualitätsvorsprungs entfallen auf die Genauigkeit; die Lesbarkeitswerte sind fast gleich.

Ein Buch · 61 Abschnitte · 67.127 Wörter · Deutsch → Englisch · zwei Prüfer · Text nicht öffentlich

Ein wissenschaftliches Buch mit 67.127 Wörtern in 61 Abschnitten wurde zweimal vom selben KI-Modell aus dem Deutschen ins Englische übersetzt, und zwar von GPT-6 Astra mit sehr hoher Denkintensität. Einmal innerhalb von ProsaBridge. Einmal direkt mit dem gesamten Buch und der Anweisung, wie ein englischsprachiges Original zu klingen. Beide Prüfer verglichen anschließend jeden Abschnitt blind mit dem deutschen Ausgangstext, ohne das Glossar und die Vorbereitung von ProsaBridge zu kennen.

FassungFehlerwertWertGenauigkeitLesbarkeitFable 5.1 mediumGPT-6 Astra medium
GPT-6 Astra innerhalb von ProsaBridge0,080,060,020,120,04
GPT-6 Astra direkt genutzt0,200,180,020,280,12

GenauigkeitLesbarkeit

Ein Buch, eine Übersetzung pro Arbeitsweise. Die direkte Übersetzung hatte das Glossar nicht, das ProsaBridge aufbaut; der Vergleich zeigt also, was die gesamte Vorbereitung bewirkt. Der Beitrag eines einzelnen Schritts lässt sich daraus nicht ablesen. Das Buch gehört einem Kunden und bleibt vertraulich; Werte und Abschnittszahlen stehen im Download.

Abb. 3

Kosten-Nutzen-Verhältnis: Rechenaufwand vs. Qualität

Weniger Fehler kosten meist mehr Rechenleistung. Weiter oben ist besser und weiter rechts ist günstiger; das beste Verhältnis liegt also oben rechts. Die Kosten sind ein Vielfaches der günstigsten Fassung, GLM-5.3 Flash allein, und die Achse ist logarithmisch: Gleiche Abstände sind gleiche Verhältnisse. Eine Linie verbindet die beiden Fassungen desselben Modells. Die schattierte Treppe ist die Grenze des besten Verhältnisses: Keine Fassung innerhalb der Treppe ist zugleich günstiger und besser als eine auf der Kante.

Grenze des besten Verhältnisses

  1. GLM-5.3 FlashModell allein · 1,65
  2. GPT-5.6 LunaModell allein4,2× · 1,00
  3. GPT-5.6 LunaMit ProsaBridge10,9× · 0,66
  4. GPT-6 AstraModell allein21,4× · 0,44
  5. GPT-5.6 SolModell allein84,9× · 0,40
  6. GPT-6 AstraMit ProsaBridge109,5× · 0,25
  7. GPT-5.6 SolMit ProsaBridge158,9× · 0,25
  8. GPT-6 AstraMit ProsaBridge501,9× · 0,14
Die Kosten sind die Rechenleistung, die jede Fassung für diese zwölf Texte gebraucht hat, zu den Listenpreisen der Modellanbieter. Sie sind nicht der Preis von ProsaBridge. Zeigen Sie auf einen Punkt, um Fassung und Zahlen zu sehen. Die Übersetzungsdienste rechnen pro Zeichen ab; DeepL erscheint deshalb als gestrichelte Linie auf Höhe seines Werts, Google Translate und Amazon Translate liegen weit unterhalb des Diagramms und sind an dessen unterem Rand benannt. Die vollständige Tabelle unter Abb. 1 nennt alle Kosten.

So entsteht der Fehlerwert

Zwei KI-Prüfer, Claude Fable 5.1 und GPT-6 Astra, lesen jede Übersetzung Seite an Seite mit ihrem Original. Sie wissen nicht, welche Fassung sie vor sich haben, und sehen die Arbeit des anderen nicht. Jeder Prüfer markiert jeden Fehler mit einer Kategorie, einem Gewicht und einer Begründung. Die Kategorien folgen MQM (Multidimensional Quality Metrics), einem Rahmen zur Bewertung von Übersetzungsqualität.

Ein leichter Fehler zählt 1 Punkt, ein schwerer Fehler 5 Punkte, ein kritischer Fehler 10 Punkte. Die Strafpunkte einer Übersetzung werden addiert, durch ihre Wortzahl geteilt und auf 100 Wörter umgerechnet. Der Wert einer Fassung für einen Text ist der Mittelwert der beiden Prüfer; ihr veröffentlichter Wert ist der Mittelwert über die zwölf Texte.

Innerhalb von ProsaBridge durchläuft ein Modell dieselben Schritte wie bei einem Kundendokument: Es liest den ganzen Text, erstellt einen Übersetzungsplan und übersetzt danach. Allein erhält dasselbe Modell nur den Text und das Ausgabeformat. Keiner der beiden Abläufe wurde für diesen Benchmark verändert.

So haben wir die Rangfolge geprüft

Die Abstände, auf die es ankommt, sind bestätigt: die drei Übersetzungsdienste am Ende, jedes Paar von der letzten KI-Fassung bis hinunter zu Amazon Translate, und 10 der 22 Nachbarpaare in ihrer veröffentlichten Reihenfolge. Die vorderen Fassungen liegen dicht beieinander; lesen Sie die ersten Plätze deshalb als Gruppe.

Nach dem Festlegen der Rangliste haben beide Prüfer jede Fassung mit der direkt darunter platzierten verglichen, Text für Text, ohne zu wissen, welche welche ist. Ein Text zählt nur dann für eine der beiden Fassungen, wenn beide Prüfer übereinstimmen.

  1. 1GPT-6 Astra, Mit ProsaBridgevs.2GPT-5.6 Sol, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  2. 2GPT-5.6 Sol, Mit ProsaBridgevs.3GPT-6 Astra, Modell allein
    2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  3. 3GPT-6 Astra, Modell alleinvs.4GPT-6 Astra, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer keinen Unterschied sahen, 8 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  4. 4GPT-6 Astra, Mit ProsaBridgevs.5GPT-5.6 Sol, Modell allein
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  5. 5GPT-5.6 Sol, Modell alleinvs.6GPT-6 Astra, Modell allein
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  6. 6GPT-6 Astra, Modell alleinvs.7Fable 5.1, Modell allein
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 8 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  7. 7Fable 5.1, Modell alleinvs.8Fable 5.1, Mit ProsaBridge
    3 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Prüfer bevorzugten die niedriger platzierte Fassung
  8. 8Fable 5.1, Mit ProsaBridgevs.9Gemini 3.8 Flash, Mit ProsaBridge
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  9. 9Gemini 3.8 Flash, Mit ProsaBridgevs.10GPT-5.6 Luna, Mit ProsaBridge
    2 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 9 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  10. 10GPT-5.6 Luna, Mit ProsaBridgevs.11Opus 5, Mit ProsaBridge
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 10 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  11. 11Opus 5, Mit ProsaBridgevs.12Fable 5.1, Modell allein
    6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 1 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 4 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  12. 12Fable 5.1, Modell alleinvs.13Gemini 3.8 Flash, Modell allein
    1 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Prüfer bevorzugten die niedriger platzierte Fassung
  13. 13Gemini 3.8 Flash, Modell alleinvs.14Fable 5.1, Mit ProsaBridge
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  14. 14Fable 5.1, Mit ProsaBridgevs.15GPT-5.6 Luna, Modell allein
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen beide Prüfer keinen Unterschied sahen, 7 Texte, bei denen die Prüfer uneinig waren
    Zu knapp für ein Urteil
  15. 15GPT-5.6 Luna, Modell alleinvs.16Grok 4.6, Mit ProsaBridge
    9 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  16. 16Grok 4.6, Mit ProsaBridgevs.17GLM-5.3 Flash, Mit ProsaBridge
    4 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 5 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  17. 17GLM-5.3 Flash, Mit ProsaBridgevs.18GLM-5.3 Flash, Modell allein
    6 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 3 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  18. 18GLM-5.3 Flash, Modell alleinvs.19Opus 5, Modell allein
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 5 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Ausgeglichen
  19. 19Opus 5, Modell alleinvs.20Grok 4.6, Modell allein
    8 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 2 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 2 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  20. 20Grok 4.6, Modell alleinvs.21DeepL, Übersetzungsdienst
    5 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 4 Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten, 3 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  21. 21DeepL, Übersetzungsdienstvs.22Google, Übersetzungsdienst
    11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  22. 22Google, Übersetzungsdienstvs.23Amazon, Übersetzungsdienst
    11 Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten, 1 Texte, bei denen die Prüfer uneinig waren
    Reihenfolge bestätigt
  • Texte, bei denen beide Prüfer die höher platzierte Fassung bevorzugten
  • Texte, bei denen beide Prüfer keinen Unterschied sahen
  • Texte, bei denen beide Prüfer die niedriger platzierte Fassung bevorzugten
  • Texte, bei denen die Prüfer uneinig waren

Grok 4.6 allein und DeepL liegen zu dicht beieinander, um sie zu trennen. Werte, die wenige Hundertstel auseinanderliegen, können an einem anderen Tag die Plätze tauschen; der Download enthält jedes Paar.

Was diese Seite nicht sagt

  • Nur Englisch nach Deutsch. Andere Sprachpaare bekommen eigene Ergebnisse.
  • Zwölf Texte mit 300 bis 500 Wörtern. ProsaBridge ist für ganze Bücher und Berichte ausgelegt, in denen Namen, Begriffe und Stil über Hunderte von Seiten hinweg gleich bleiben müssen. Kurze Texte zeigen nur einen Teil dieses Unterschieds: Beim ganzen Buch in Abb. 2 war der Abstand zum selben Modell größer als bei den zwölf Texten.
  • Ein einzelner Durchgang. Die Zahlen sind keine Mittelwerte über wiederholte Durchgänge. Unterschiede von wenigen Hundertstelpunkten können Zufallsschwankungen sein.
  • Die Prüfer sind KI-Modelle, und zwei der teilnehmenden Modelle sind zugleich die Prüfer. Ihre getrennten Werte sind sichtbar, damit Sie das selbst prüfen können. Der Sieger liegt auch dann vorn, wenn nur einer der beiden Prüfer zählt.

Was wir nicht veröffentlichen

  • Die zwölf Texte. Sie wurden für diesen Benchmark geschrieben und nie veröffentlicht; kein KI-Modell hat sie oder eine Übersetzung davon gesehen. Eine Veröffentlichung brächte sie in die nächsten Trainingsdaten und machte jeden späteren Durchgang unbrauchbar. Titel, Textsorte, Länge und Schwierigkeit stehen weiter unten.
  • Die Anweisungen, die ProsaBridge den Modellen gibt, und die Anweisungen, denen die Prüfer folgen.
  • Was die Durchgänge gekostet haben. Das Kostendiagramm zeigt nur Vielfache der günstigsten Fassung.
  • Die Notizen der Prüfer und die Übersetzungen selbst, weil sie die Texte offenlegen würden.

Die zwölf Texte

Sieben Kurzgeschichten und fünf Sachtexte, jeder so geschrieben, dass er auf eine bestimmte Art schwer zu übersetzen ist.

TextArtWörterWas ihn schwer macht
1The LeaseErzählung, Dialog431Wechsel von Sie zu du, Dialog, trockener Humor
2GravelErzählung, Innensicht485Gedanken in erlebter Rede, umgangssprachliche Einschübe, unmarkierte Fragen
3The Orchard LedgerErzählung, lyrisch463Eine lange Metapher, die von Anfang bis Ende tragen muss
4SouthpawErzählung, Szene449Kurze, harte Sätze neben einem einzigen langen
5The CommitteeErzählung, Satire446Lange Schachtelsätze, Einschübe, Ironie, die von der Wortstellung abhängt
6Moving the NeedleErzählung, Arbeitswelt462Viele Redewendungen und ein Wortspiel, von dem der ganze Text abhängt
7The VisitorErzählung, Innensicht458Ein absichtlich unklares „sie“, das unklar bleiben muss
8Remarks at the Dedication of the Cedar Run Flood MemorialSachtext, Rede441Amerikanischer Festredeton, Wiederholung als Stilmittel, Namen von Institutionen
9Allision of the Ferry Marguerite Bay at Harbor Point TerminalSachtext, Unfallbericht478Nautische Begriffe, Passiv, exakte Zeiten und Maße
10The Sleep of SwiftsSachtext, Populärwissenschaft493Lyrisches Wissenschaftsschreiben zwischen Daten und Bildern
11Expanding District Heating in Mid-Sized CitiesSachtext, Politikpapier436„Sollte“, „muss“ und „kann“, die ihre genaue Stärke behalten müssen; falsche Freunde; gleichbleibende Begriffe
12Midterm Evaluation of the Aldercreek Adult Literacy ProgramSachtext, Evaluationsbericht437Begriffspaare, die getrennt bleiben müssen, vorsichtige Zuschreibungen, abgewogene Empfehlungen

Vor der Veröffentlichung entfernte Modelle

Diese Modelle haben während der Entwicklung teilgenommen und fehlen in den veröffentlichten Ergebnissen. Jede Entfernung ist mit ihren Belegen dokumentiert.

Claude Sonnet 5
Nach sieben Texten wegen schwacher Übersetzungsqualität entfernt: 3,18 und 3,22 Fehlerpunkte pro 100 Wörter, hinter jedem anderen KI-Modell zu dieser Zeit.
Kimi K2 Thinking
Entfernt, weil es bei drei der sieben Texte das Ausgabelimit des Anbieters erreichte, ohne eine Antwort zu liefern.
Mistral Large 3
Entfernt, weil es eigene Dokumentformatierung hinzufügte und übersetzten Text zurückgab, wo der Ablauf feste Referenzcodes verlangt.
Gemini 3.1 Pro und GPT-5.6 Terra
Vor dem veröffentlichten Durchgang zurückgezogen: Für ihren Preis waren ihre Werte zu schwach. Günstigere Modelle erreichten bessere Werte, und bessere Modelle kosteten etwa dasselbe. Ihre früheren Ergebnisse sind archiviert.

Daten herunterladen

Der Benchmark-Durchgang: jede Fassung jedes Texts, wie jeder Prüfer sie bewertet hat, die Fehlerzahlen nach Gewicht und Art, die Kosten als Vielfache und die Nachbarvergleiche.

Datensatz 1.0 herunterladen

Die Buchstudie: die Werte beider Übersetzungen insgesamt, nach Fehlerart und je Prüfer, dazu der Umfang des Buchs. Kein Text aus dem Buch.

Datensatz zum Buch herunterladen
Durchgang
translationbench-run-fa35fa02-3190-4f82-b379-8d05b7dde5d7
Version
1.0 (7.2)
Abgeschlossen
12. September 2026