Definición
Una representación que ordena los elementos léxicos por frecuencia observada decreciente y asigna a cada rango r la frecuencia correspondiente f(r); resume cómo se reparten las ocurrencias de tokens entre tipos distintos en un texto o corpus.
Principio
Principio
Ordenar por rango produce un resumen compacto de la concentración de uso y del comportamiento de la cola: la forma del mapeo rango–frecuencia codifica la concentración (la masa que poseen los primeros rangos), la intensidad de la cola (la tasa de descenso de las frecuencias) y posibles regularidades (segmentos de ley de potencia, mesetas, recortes) que son informativas para modelado y comparación.
Demostración
Demostración
Escenario ilustrativo: Para un corpus, calcúlese el recuento por tipo, ordenen los tipos por recuento decreciente, asignen rango 1 al tipo más frecuente y tabúlese f(r) para cada r. Trazar f(r) o su logaritmo frente al rango revela la forma de la distribución; reconocimiento: un descenso inicial pronunciado indica fuerte concentración, una cola larga y poco pronunciada indica muchos tipos de baja frecuencia.
Aplicación incorrecta
Aplicación incorrecta
Comparar listas rango–frecuencia en bruto entre corpus de distinto tamaño o con distinta tokenización sin normalización induce a error porque los rangos y las frecuencias absolutas dependen de la escala. Interpretar la proximidad de rango como similitud semántica es un error de categoría: el rango refleja frecuencia distributiva, no significado.
Consecuencia
Consecuencia
Las distribuciones rango–frecuencia alimentan la selección de modelos, la truncación de vocabulario, estrategias de suavizado y métricas de comparación de corpus; causalmente, sus propiedades de cola pesada implican rareza persistente que afecta evaluación, planificación de cobertura léxica y el manejo de palabras raras en sistemas NLP.
Inversión
Inversión
En corpus pequeños o muy curados el orden por rango puede ser inestable (los rangos fluctúan con pequeños cambios de muestra); los empates en frecuencia requieren reglas deterministas de desempate para que los rangos sean reproducibles. Para usos sensibles al contexto (p. ej. colocaciones), el simple rango–frecuencia omite información condicional y puede inducir a error.
Límite
Límite
Claramente dentro: una lista de tipos ordenada por frecuencia derivada de las ocurrencias token contadas bajo una tokenización definida. Caso límite: rango–frecuencia obtenido sobre lemas en lugar de tokens de superficie — la forma cambia. Claramente fuera: medidas de importancia contextual (TF‑IDF por documento) o mediciones de asociación (PMI) que condicionan frecuencias al contexto en vez de usar un rango global.
Tensión semántica
Tensión semántica
Las distribuciones rango–frecuencia comprometen concisión frente a identidad: resumen la forma distributiva global mientras descartan la identidad léxica y los roles contextuales, creando tensión entre el deseo de un resumen compacto y la necesidad de interpretabilidad a nivel de token.
Síntesis
Síntesis
La distribución rango–frecuencia es el resumen macro canónico de la asignación de tokens entre tipos: expone la concentración y la estructura de la cola, esenciales para la modelización cuantitativa y decisiones de ingeniería, pero debe interpretarse junto con la identidad de los tokens, las elecciones de preprocesamiento y medidas contextuales para sostener afirmaciones lingüísticas sustantivas.