Définition
Mesure quantitative exprimant la proportion d’unités lexicales porteuses de contenu (généralement noms, verbes principaux, adjectifs et adverbes) par rapport au nombre total de mots ou tokens dans un segment de texte, utilisée comme indice de concentration informationnelle par mot.
Principe
Principe
Les textes présentant une proportion plus élevée de mots de contenu ont tendance à condenser davantage d’information par token, mais la métrique dépend de la manière dont mots et catégories sont segmentés et définis dans une langue ou un schéma d’annotation donné.
Démonstration
Démonstration
Scénario illustratif → Situation : comparaison de deux courts paragraphes ; Reconnaissance : l’analyste étiquette les tokens comme mots de contenu ou mots fonctionnels ; Action : calculer nombre de mots de contenu ÷ total des tokens pour chaque paragraphe ; Conséquence : le paragraphe ayant le ratio le plus élevé est décrit comme ayant une densité lexicale supérieure, ce qui suggère plus d’information par mot selon ce schéma d’encodage.
Mauvaise application
Mauvaise application
Interpréter la densité lexicale comme un proxy direct de lisibilité ou de qualité stylistique sans tenir compte du genre, de la finalité ou de la structure morphologique ; cela confond concentration informationnelle et compréhensibilité ou valeur esthétique.
Conséquence
Conséquence
La densité lexicale est utile pour comparer registres, genres ou choix de traduction, et pour le profilage de corpus ; elle peut induire en erreur lorsqu’elle est appliquée entre langues de typologies morphologiques différentes ou lorsque les règles de tokenisation/annotation varient.
Inversion
Inversion
Dans les langues agglutinantes ou polysynthétiques, l’information est souvent portée par des morphèmes liés plutôt que par des tokens mots séparés ; la densité lexicale fondée sur les mots peut donc sous-estimer la concentration d’information ; inversement, les langues analytiques présentent d’autres distributions.
Limite
Limite
Clearly within: un paragraphe en prose analysé avec un tagset de catégories grammaticales explicite et un comptage des tokens lexicaux ; Boundary case: textes comportant beaucoup de contractions ou clitiques où les choix de tokenisation influencent les décomptes ; Clearly outside: affirmations qualitatives sur la « profondeur » ou la « complexité » ignorant les proportions mesurables des tokens.
Tension sémantique
Tension sémantique
Densité d’information ↔ Lisibilité — une densité lexicale élevée indique plus d’information par token mais peut s’opposer à la facilité de traitement pour certains lecteurs ou objectifs communicationnels.
Synthèse
Synthèse
La densité lexicale est une métrique descriptive et contingente : elle quantifie un aspect de la structure informationnelle d’un texte sous un régime de tokenisation et d’annotation donné, et doit donc être interprétée en fonction de la langue, du genre et de la méthode.