Definition
Eine quantitative Messgröße, die den Anteil inhaltstragender lexikalischer Einheiten (typischerweise Substantive, Vollverben, Adjektive und Adverbien) an der Gesamtzahl der Wörter oder Tokens in einem Textabschnitt ausdrückt; verwendet als Index für die Informationskonzentration pro Wort.
Prinzip
Prinzip
Texte mit höheren Anteilen an Inhaltswörtern bündeln tendenziell mehr informationelle Inhalte pro Token; die Metrik hängt jedoch davon ab, wie Wörter und Kategorien in einer bestimmten Sprache oder Annotation definiert und segmentiert werden.
Demonstration
Demonstration
Illustratives Szenario → Situation: Zwei kurze Absätze werden verglichen; Erkennung: Analytiker kennzeichnen Tokens als Inhalts- oder Funktionswörter; Handlung: Inhaltswortanzahl ÷ Gesamt-Tokens für jeden Absatz berechnen; Folge: Der Absatz mit dem höheren Verhältnis wird als lexikalisch dichter beschrieben, was unter diesem Kodierschema auf mehr Information pro Wort hindeutet.
Fehlanwendung
Fehlanwendung
Lexikalische Dichte als direkten Proxy für Lesbarkeit oder stilistische Qualität aufzufassen, ohne Genre, Zweck oder morphologische Struktur zu berücksichtigen; dies verwechselt informationelle Konzentration mit Verstehbarkeit oder ästhetischem Wert.
Konsequenz
Konsequenz
Lexikalische Dichte eignet sich zur Gegenüberstellung von Registern, Genres oder Übersetzungsvarianten und zur Korpusprofilierung; sie kann irreführen, wenn sie zwischen Sprachen mit unterschiedlicher morphologischer Typologie angewandt wird oder Tokenisierung/Tagging-Regeln variieren.
Umkehrung
Umkehrung
In agglutinierenden oder polysynthetischen Sprachen wird Information häufig in gebundenen Morphemen statt in getrennten Worttokens getragen; wortbasierte lexikalische Dichte kann deshalb die Informationsdichte unterschätzen; analytische Sprachen zeigen andere Verteilungen.
Abgrenzung
Abgrenzung
Clearly within: ein Prosaparagraph, der mit einem expliziten Wortart-Tagset analysiert und dessen Inhaltswort-Tokens gezählt werden; Boundary case: Texte mit vielen Kontraktionen oder Clitika, bei denen Tokenisierungsentscheidungen die Zählungen beeinflussen; Clearly outside: qualitative Behauptungen über „Tiefe“ oder „Komplexität“, die messbare Tokenproportionen ignorieren.
Semantische Spannung
Semantische Spannung
Informationsdichte ↔ Lesbarkeit — höhere lexikalische Dichte weist auf mehr Information pro Token hin, kann jedoch der Verarbeitungsleichtigkeit für bestimmte Leser oder kommunikationsbezogene Ziele widersprechen.
Synthese
Synthese
Lexikalische Dichte ist eine beschreibende, kontingente Metrik: Sie quantifiziert einen Aspekt der informationellen Textstruktur unter einem spezifischen Tokenisierungs- und Taggingregime und muss daher in Relation zu Sprache, Genre und Methode interpretiert werden.