Définition
Relation empirique entre le nombre de tokens N et la taille de vocabulaire observée V(N), généralement exprimée V(N) = K · N^β (avec constantes K>0 et 0<β<1 pour de nombreux corpus de langue naturelle), indiquant que le vocabulaire croît de façon sous‑linéaire avec la longueur du texte.
Principe
Principe
Lorsque le nombre de tokens augmente, de nouveaux types distincts continuent d’apparaître mais à un rythme décélérant : la croissance marginale du vocabulaire par token supplémentaire diminue approximativement selon une loi de puissance gouvernée par l’exposant β, de sorte que doubler les tokens accroît typiquement le vocabulaire d’un facteur 2^β plutôt que d’un facteur deux.
Démonstration
Démonstration
Scénario illustratif : Un corpus de N = 1 000 000 de tokens ajusté par V(N)=K·N^β avec β=0,5 implique que doubler la taille du corpus à 2 000 000 de tokens augmente V d’un facteur ≈2^0,5≈1,414 ; reconnaissance : le vocabulaire observé s’étend mais avec une nouveauté marginale décroissante par token.
Mauvaise application
Mauvaise application
Traiter K et β comme des constantes universelles pour toutes les langues, domaines, pipelines de prétraitement ou choix de tokenisation est incorrect. Extrapoler la relation bien au‑delà des données observées sans vérifier l’ajustement, ou ignorer la lemmatisation et la normalisation orthographique, conduit à des prédictions trompeuses.
Conséquence
Conséquence
La loi de Heaps fournit une base pratique pour estimer les tailles de vocabulaire attendues, planifier le stockage de lexiques et fixer des coupures de vocabulaire pour modèles de langue ; elle implique causalement que les systèmes à vocabulaire ouvert doivent gérer une longue queue de types rares qui s’accroît lentement avec les données.
Inversion
Inversion
Pour des N très petits, la croissance du vocabulaire peut sembler approximativement linéaire (β≈1) avant que le régime sous‑linéaire n’apparaisse. Dans des vocabulaires restreints ou clos (lexiques spécialisés, taxonomies), V(N) peut saturer et dévier d’une loi de puissance ; le prétraitement (lemmatisation, normalisation des tokens) modifie les estimations de K et β.
Limite
Limite
Clairement dans : grands corpus de langue naturelle tokenisés où de nouveaux types token continuent d’apparaître avec l’accroissement de N. Cas frontière : corpus multilingues ou très bruyants où le β ajusté varie selon la langue/sous‑domaine. Clairement hors : lexiques finis fermés, langages factices à vocabulaire borné, ou analyses comptant des lemmes après forte normalisation et atteignant la saturation.
Tension sémantique
Tension sémantique
La loi de Heaps est un résumé empirique concis utile pour des arbitrages techniques (stockage, troncature du vocabulaire) mais entre en tension avec la recherche d’explications causales de la croissance lexicale (p. ex. modèles génératifs vs d’échantillonnage) ; choisir un ajustement pragmatique plutôt qu’un modèle explicatif crée une tension.
Synthèse
Synthèse
La loi de Heaps résume le fait empirique courant que la croissance du vocabulaire ralentit avec la taille du corpus et fournit des attentes de mise à l’échelle actionnables pour la conception de corpus et le traitement automatique, mais ses paramètres sont descriptifs et sensibles au domaine plutôt que des lois universelles.