CommencezCommencez gratuitement

Modifier les pondérations de fréquence

Jusqu'ici, vous avez simplement compté les termes dans les documents au moyen de DocumentTermMatrix ou TermDocumentMatrix. Dans cet exercice, vous allez découvrir la pondération TfIdf plutôt que la fréquence simple des termes. TfIdf signifie fréquence du terme – fréquence inverse des documents et s'emploie quand le corpus est volumineux mais que la diversité des termes est limitée.

TfIdf compte les occurrences des termes (c.-à-d. Tf), normalise la valeur selon la longueur du document, puis pénalise cette valeur à mesure qu'un mot apparaît souvent dans l'ensemble des documents. C'est intuitif : si un mot est très courant, il est important, mais pas révélateur. Cet effet de pénalisation est capturé par la fréquence inverse des documents (c.-à-d. Idf).

Par exemple, l'examen de notes du service à la clientèle peut inclure le terme « cu » comme abrégé de « customer ». Une note pourrait indiquer « the cu has a damaged package » et une autre « cu called with question about delivery ». Avec la pondération par fréquence des documents, « cu » apparaît deux fois, on s'attend donc à ce qu'il soit informatif. Toutefois, avec TfIdf, « cu » est pénalisé parce qu'il apparaît dans tous les documents. Par conséquent, « cu » n'est pas considéré comme nouveau, sa valeur est donc réduite vers 0, ce qui permet à d'autres termes d'avoir des valeurs plus élevées pour l'analyse.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a TDM
tdm <- ___

# Convert it to a matrix
tdm_m <- ___

# Examine part of the matrix
tdm_m[___, ___]
Modifier et exécuter le code