Définition
Distance linéaire moyenne, mesurée en nombre de tokens intercalés, entre têtes syntaxiques et dépendants dans un corpus annoté en dépendances ; calculée comme la moyenne des différences absolues de positions de tokens pour l’ensemble des dépendances annotées et utilisée comme indice de localité syntaxique.
Principe
Principe
Une distance de dépendance moyenne plus courte indique une plus grande localité linéaire des relations syntaxiques, corrélant souvent avec une charge mnésique à court terme plus faible et un traitement incrémental plus rapide ; des distances plus longues signalent une plus grande séparation entre éléments dépendants et des demandes de traitement potentielles accrues.
Démonstration
Démonstration
Scénario illustratif → Phrase 1 (sujet–verbe adjacents) : « Les chats dorment. » Distance sujet–verbe = 1. Phrase 2 (avec proposition relative intercalée) : « Le chat que le chien poursuivait dort. » La distance sujet–verbe est plus grande du fait du matériel intercalé ; la distance moyenne de dépendance calculée pour les dépendances de la Phrase 2 sera plus élevée, ce qui prédit un coût de traitement plus important sous les hypothèses de localité.
Mauvaise application
Mauvaise application
Interpréter une distance de dépendance moyenne plus faible comme preuve de simplicité syntaxique sans tenir compte de la densité de dépendances, des multiples emboîtements, des différences de schéma d’annotation ou du rôle du marquage morphologique et des indices prosodiques susceptibles de compenser la séparation linéaire.
Conséquence
Conséquence
La distance de dépendance est utilisée en comparaisons typologiques, études de registre et prédictions psycholinguistiques ; des augmentations agrégées de la distance moyenne de dépendance entre corpus suggèrent une séparation linéaire moyenne plus grande des arguments et peuvent corréler avec des temps de lecture plus longs ou une charge cognitive supérieure dans des modèles de traitement, sous contrôle d’annotation et de genre.
Inversion
Inversion
Dans les langues à ordre des mots libre, avec déclinaison étendue, morphologie riche ou indices prosodiques prononcés, la distance linéaire peut moins bien prédire le coût de traitement ; les dépendances non projectives ou des conventions d’annotation différentes compliquent aussi l’interprétation des mesures de distance linéaire.
Limite
Limite
Clairement dans la définition : corpus annotés selon un schéma de dépendances et une tokenisation cohérents, distance mesurée comme différence absolue de positions de tokens. Cas limite : comparaisons inter-corpus lorsque parseurs ou tokenisations diffèrent. Clairement hors : mesures de profondeur syntaxique basées sur la constituency qui n’utilisent pas la distance linéaire tête–dépendant.
Tension sémantique
Tension sémantique
Distance de Dépendance ↔ Densité d’Information — réduire la distance linéaire diminue le coût de localité mais peut concentrer l’information par mot, produisant un compromis entre localité et charge informationnelle par token.
Synthèse
Synthèse
La distance moyenne de dépendance est un proxy quantifiable et reproductible de la localité syntaxique et un prédicteur informatif dans de nombreux contextes, mais les inférences sur le traitement cognitif exigent une annotation contrôlée, la prise en compte des indices morphologiques et prosodiques et des preuves complémentaires.