 ##  [Distribución Rango–Frecuencia](/es/node/70346) 

 Definición

Una representación que ordena los elementos léxicos por frecuencia observada decreciente y asigna a cada rango r la frecuencia correspondiente f(r); resume cómo se reparten las ocurrencias de tokens entre tipos distintos en un texto o corpus.

 

 

 

 

 

 





## Principio

Principio

Ordenar por rango produce un resumen compacto de la concentración de uso y del comportamiento de la cola: la forma del mapeo rango–frecuencia codifica la concentración (la masa que poseen los primeros rangos), la intensidad de la cola (la tasa de descenso de las frecuencias) y posibles regularidades (segmentos de ley de potencia, mesetas, recortes) que son informativas para modelado y comparación.

 

 

 

 

 





## Demostración

Demostración

Escenario ilustrativo: Para un corpus, calcúlese el recuento por tipo, ordenen los tipos por recuento decreciente, asignen rango 1 al tipo más frecuente y tabúlese f(r) para cada r. Trazar f(r) o su logaritmo frente al rango revela la forma de la distribución; reconocimiento: un descenso inicial pronunciado indica fuerte concentración, una cola larga y poco pronunciada indica muchos tipos de baja frecuencia.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Comparar listas rango–frecuencia en bruto entre corpus de distinto tamaño o con distinta tokenización sin normalización induce a error porque los rangos y las frecuencias absolutas dependen de la escala. Interpretar la proximidad de rango como similitud semántica es un error de categoría: el rango refleja frecuencia distributiva, no significado.

 

 

 

 

 





## Consecuencia

Consecuencia

Las distribuciones rango–frecuencia alimentan la selección de modelos, la truncación de vocabulario, estrategias de suavizado y métricas de comparación de corpus; causalmente, sus propiedades de cola pesada implican rareza persistente que afecta evaluación, planificación de cobertura léxica y el manejo de palabras raras en sistemas NLP.

 

 

 

 

## Inversión

Inversión

En corpus pequeños o muy curados el orden por rango puede ser inestable (los rangos fluctúan con pequeños cambios de muestra); los empates en frecuencia requieren reglas deterministas de desempate para que los rangos sean reproducibles. Para usos sensibles al contexto (p. ej. colocaciones), el simple rango–frecuencia omite información condicional y puede inducir a error.

 

 

 

 

 





## Límite

Límite

Claramente dentro: una lista de tipos ordenada por frecuencia derivada de las ocurrencias token contadas bajo una tokenización definida. Caso límite: rango–frecuencia obtenido sobre lemas en lugar de tokens de superficie — la forma cambia. Claramente fuera: medidas de importancia contextual (TF‑IDF por documento) o mediciones de asociación (PMI) que condicionan frecuencias al contexto en vez de usar un rango global.

 

 

 

 

 





## Tensión semántica

Tensión semántica

Las distribuciones rango–frecuencia comprometen concisión frente a identidad: resumen la forma distributiva global mientras descartan la identidad léxica y los roles contextuales, creando tensión entre el deseo de un resumen compacto y la necesidad de interpretabilidad a nivel de token.

 

 

 

 

 





## Síntesis

Síntesis

La distribución rango–frecuencia es el resumen macro canónico de la asignación de tokens entre tipos: expone la concentración y la estructura de la cola, esenciales para la modelización cuantitativa y decisiones de ingeniería, pero debe interpretarse junto con la identidad de los tokens, las elecciones de preprocesamiento y medidas contextuales para sostener afirmaciones lingüísticas sustantivas.