Definición
Relación empírica entre el número de tokens N y el tamaño de vocabulario observado V(N), comúnmente expresada como V(N) = K · N^β (con constantes K>0 y 0<β<1 en muchos corpus de lengua natural), lo que significa que el vocabulario crece de manera sublineal con la longitud del texto.

Principio

Principio
A medida que aumenta el número de tokens, continúan apareciendo nuevos tipos distintos pero a una tasa decreciente: el crecimiento incremental del vocabulario por token adicional disminuye aproximadamente según una ley de potencia gobernada por el exponente β, de modo que duplicar los tokens normalmente aumenta el vocabulario por un factor 2^β en lugar de doblarlo.

Demostración

Demostración
Escenario ilustrativo: Un corpus con N = 1 000 000 de tokens ajustado a V(N)=K·N^β con β=0,5 implica que duplicar el tamaño del corpus a 2 000 000 de tokens aumenta V por un factor ≈2^0,5≈1,414; reconocimiento: el vocabulario observado se expande pero con una novedad marginal decreciente por token.

Aplicación incorrecta

Aplicación incorrecta
Tratar K y β como constantes universales para todas las lenguas, dominios, canalizaciones de preprocesamiento o decisiones de tokenización es incorrecto. Extrapolar la relación muy por encima de los datos observados sin comprobar el ajuste, o ignorar la lematización y la normalización ortográfica, conduce a predicciones engañosas.

Consecuencia

Consecuencia
La ley de Heaps proporciona una base práctica para estimar tamaños de vocabulario esperados, planificar almacenamiento de léxicos y fijar umbrales de vocabulario para modelos de lenguaje; causalmente, implica que los sistemas de vocabulario abierto deben gestionar una cola larga y lentamente acumulativa de tipos raros cuando aumentan los datos.

Inversión

Inversión
Para N muy pequeños, el crecimiento del vocabulario puede parecer aproximadamente lineal (β≈1) antes de que surja el régimen sublineal. En vocabularios restringidos o cerrados (léxicos especializados, taxonomías), V(N) puede saturarse y desviarse de la ley de potencia; el preprocesamiento (lematización, normalización de tokens) altera las estimaciones de K y β.

Límite

Límite
Claramente dentro: corpus grandes y tokenizados de lengua natural donde continúan apareciendo nuevos tipos con el aumento de N. Caso límite: corpus multilingües o muy ruidosos donde el β ajustado varía por lengua/subdominio. Claramente fuera: léxicos finitos cerrados, lenguajes de juguete con vocabularios acotados o análisis que cuentan lemas tras fuerte normalización y alcanzan saturación.

Tensión semántica

Tensión semántica
La ley de Heaps es un resumen empírico compacto útil para compensaciones de ingeniería (almacenamiento, truncamiento de vocabulario) pero compite con la búsqueda de explicaciones causales del crecimiento léxico (p. ej. modelos generativos frente a cuentas de muestreo); elegir ajuste pragmático frente a modelo explicativo genera tensión.

Síntesis

Síntesis
La ley de Heaps resume el patrón empírico de que el crecimiento del vocabulario se desacelera con el tamaño del corpus y aporta expectativas de escalado útiles para NLP y diseño de corpus, pero sus parámetros son descriptivos y sensibles al dominio, no leyes universales.