Definition
Eine automatische, präzisionsorientierte Metrik zur Bewertung maschineller Übersetzungen durch Vergleich von n-Gramm-Übereinstimmungen zwischen einer Kandidatenübersetzung und einer oder mehreren Referenzübersetzungen; sie fasst n-Gramm-Präzisionen (typischerweise mittels geometrischem Mittel) zusammen und wendet eine Kürzenstrafe für zu kurze Kandidaten an.
Prinzip
Prinzip
Aggregation lexikalischer n‑Gramm‑Präzisionen zu einem einheitlichen Score mit Anpassung an Längenabweichungen; höhere n‑Gramm‑Übereinstimmung und nähere Längenparität erhöhen den Score.
Demonstration
Demonstration
Illustratives Szenario → Situation: Ein System erzeugt Kandidatenübersetzungen für einen Korpus, für den Referenzen vorliegen. Erkennung: Berechne Unigramm-, Bigramm‑…‑Präzisionen und das Verhältnis Kandidaten‑/Referenzlänge. Handlung: Präzisionen (geometrisches Mittel) aggregieren und Kürzenstrafe anwenden. Konsequenz: Der BLEU‑Wert auf Korpusebene ordnet Systeme nach lexikalischem Überlapp und Längenanpassung für diesen Korpus ein.
Fehlanwendung
Fehlanwendung
BLEU als verlässliches Urteil auf Satzebene für Adequatheit oder Fluency verwenden oder einem niedrigen Score mit nur einer Referenz definitive Aussagekraft zuschreiben; der semantische Fehler ist die Gleichsetzung der Korpusebene-Zusammenfassung mit satzweiser inhaltlicher Angemessenheit.
Konsequenz
Konsequenz
Bei Nutzung in Entwicklung oder Auswahl leitet BLEU die Optimierung hin zu höherem lexikalischem Überlapp und Längenanpassung an vorhandene Referenzen; ohne Kontextangaben (Referenzanzahl, Korpusgröße) kann es irreführen, wie gut Übersetzungen tatsächlich sind.
Umkehrung
Umkehrung
Bei sehr kleinen Datensätzen, nur einer Referenz, starken abstrakten Paraphrasen oder Sprachpaaren mit großem lexico‑semantischen Spielraum verliert BLEU seine intendierte Interpretierbarkeit und kann akzeptable Ausgaben systematisch abwerten.
Abgrenzung
Abgrenzung
Eindeutig innerhalb: vergleichende, korpusebene Bewertung von MT‑Systemen mit einer oder mehreren Referenzen. Grenzfall: einzelne Satzbewertung mit einer Referenz (unzuverlässig). Eindeutig außerhalb: direkte Messung semantischer Angemessenheit, Stimmigkeit oder menschlicher Akzeptanz ohne ergänzende Bewertung.
Semantische Spannung
Semantische Spannung
Präzisionsorientierter lexikalischer Überlapp (BLEU) ↔ Metriken oder Urteile, die Rückruf, semantische Äquivalenz oder Sprachqualität betonen; BLEU‑Fokus opfert Sensitivität gegenüber Paraphrase zugunsten lexikalischer Übereinstimmung.
Synthese
Synthese
BLEU ist ein kompaktes, korpusebenes Maß für lexikalischen Überlapp und Längenparität, nützlich für systemvergleich unter kontrollierten Referenzbedingungen; es ersetzt jedoch nicht Bewertungen von Adequatheit oder Fluency und sollte ergänzt werden.