 ##  [Puntuación BLEU](/es/node/71300) 

 Definición

Métrica automática orientada a la precisión que evalúa la salida de traducción automática comparando coincidencias de n-gramas entre la traducción candidata y una o varias traducciones de referencia; agrega precisiones de distintos órdenes (habitualmente mediante media geométrica) y aplica una penalización por brevedad para castigar candidatos excesivamente cortos.

 

 

 

 

 

 





## Principio

Principio

Sistematizar la coincidencia léxica en varios órdenes de n‑grama en un único puntaje ajustado por desajustes de longitud; mayor solapamiento de n‑gramas y mayor paridad de longitud elevan el puntaje.

 

 

 

 

 





## Demostración

Demostración

Escenario ilustrativo → Situación: un sistema genera traducciones candidatas para un corpus con referencias disponibles. Reconocimiento: calcular precisiones de unigramas, bigramas, etc., y la razón longitud candidata/longitud referencia. Acción: agregar precisiones (media geométrica) y aplicar la penalización por brevedad. Consecuencia: el BLEU a nivel de corpus permite comparar sistemas según solapamiento léxico y paridad de longitud en ese corpus.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Usar BLEU como indicador fiable a nivel de frase para la adecuación o la fluidez, o considerar que un puntaje bajo con una sola referencia prueba inequívocamente mala calidad; el error es asumir que el resumen de precisión a nivel de corpus equivale a adecuación frase por frase.

 

 

 

 

 





## Consecuencia

Consecuencia

Al emplearse en desarrollo o selección, BLEU orienta la optimización hacia mayor solapamiento léxico y ajuste de longitud con las referencias disponibles; reportado sin contexto (n.º de referencias, tamaño del corpus) puede dar una impresión equivocada de la calidad real.

 

 

 

 

## Inversión

Inversión

Las propiedades de BLEU dejan de ser interpretables en conjuntos muy pequeños, con una sola referencia, para paráfrasis muy abstractas o en pares de lenguas con gran variación léxica para expresar lo mismo; en esos casos, BLEU puede infraestimar salidas aceptables.

 

 

 

 

 





## Límite

Límite

Claramente dentro: evaluación comparativa a nivel de corpus de sistemas con una o más referencias. Caso límite: evaluación de una sola frase con una referencia (poco fiable). Claramente fuera: medidas directas de adecuación semántica, fluidez o aceptación humana sin evaluación complementaria.

 

 

 

 

 





## Tensión semántica

Tensión semántica

Solapamiento léxico orientado a la precisión (BLEU) ↔ métricas o juicios que priorizan el recall, la equivalencia semántica o la fluidez; confiar en BLEU favorece la coincidencia léxica frente a la sensibilidad a paráfrasis.

 

 

 

 

 





## Síntesis

Síntesis

BLEU es un indicador compacto a nivel de corpus del solapamiento léxico y la paridad de longitud útil para comparar sistemas bajo condiciones controladas de referencia, pero no sustituye la evaluación de adecuación o fluidez y debe complementarse.