Definición
Métrica automática orientada a la precisión que evalúa la salida de traducción automática comparando coincidencias de n-gramas entre la traducción candidata y una o varias traducciones de referencia; agrega precisiones de distintos órdenes (habitualmente mediante media geométrica) y aplica una penalización por brevedad para castigar candidatos excesivamente cortos.
Principio
Principio
Sistematizar la coincidencia léxica en varios órdenes de n‑grama en un único puntaje ajustado por desajustes de longitud; mayor solapamiento de n‑gramas y mayor paridad de longitud elevan el puntaje.
Demostración
Demostración
Escenario ilustrativo → Situación: un sistema genera traducciones candidatas para un corpus con referencias disponibles. Reconocimiento: calcular precisiones de unigramas, bigramas, etc., y la razón longitud candidata/longitud referencia. Acción: agregar precisiones (media geométrica) y aplicar la penalización por brevedad. Consecuencia: el BLEU a nivel de corpus permite comparar sistemas según solapamiento léxico y paridad de longitud en ese corpus.
Aplicación incorrecta
Aplicación incorrecta
Usar BLEU como indicador fiable a nivel de frase para la adecuación o la fluidez, o considerar que un puntaje bajo con una sola referencia prueba inequívocamente mala calidad; el error es asumir que el resumen de precisión a nivel de corpus equivale a adecuación frase por frase.
Consecuencia
Consecuencia
Al emplearse en desarrollo o selección, BLEU orienta la optimización hacia mayor solapamiento léxico y ajuste de longitud con las referencias disponibles; reportado sin contexto (n.º de referencias, tamaño del corpus) puede dar una impresión equivocada de la calidad real.
Inversión
Inversión
Las propiedades de BLEU dejan de ser interpretables en conjuntos muy pequeños, con una sola referencia, para paráfrasis muy abstractas o en pares de lenguas con gran variación léxica para expresar lo mismo; en esos casos, BLEU puede infraestimar salidas aceptables.
Límite
Límite
Claramente dentro: evaluación comparativa a nivel de corpus de sistemas con una o más referencias. Caso límite: evaluación de una sola frase con una referencia (poco fiable). Claramente fuera: medidas directas de adecuación semántica, fluidez o aceptación humana sin evaluación complementaria.
Tensión semántica
Tensión semántica
Solapamiento léxico orientado a la precisión (BLEU) ↔ métricas o juicios que priorizan el recall, la equivalencia semántica o la fluidez; confiar en BLEU favorece la coincidencia léxica frente a la sensibilidad a paráfrasis.
Síntesis
Síntesis
BLEU es un indicador compacto a nivel de corpus del solapamiento léxico y la paridad de longitud útil para comparar sistemas bajo condiciones controladas de referencia, pero no sustituye la evaluación de adecuación o fluidez y debe complementarse.