Association de mots
Comme prévu, vous observez des thèmes similaires dans tout le dendrogramme. De retour aux commentaires positifs, vous décidez d'examiner les expressions les plus fréquentes qui sont apparues dans les nuages de mots. Vous espérez trouver des termes associés à l'aide de la fonction findAssocs() de tm. Vous voulez maintenant vérifier s'il y a quelque chose de surprenant, sachant qu'il y a de longues heures de travail et un manque d'équilibre travail‑vie personnelle.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
Le corpus amzn_pros_corp a été nettoyé à l'aide des fonctions personnalisées comme auparavant.
- Construisez une TDM appelée
amzn_p_tdmà partir deamzn_pros_corpaveccontrol = list(tokenize = tokenizer). - Créez
amzn_p_men convertissantamzn_p_tdmen matrice. - Créez
amzn_p_freqen appliquantrowSums()àamzn_p_m. - Créez
term_frequencyen appliquantsort()àamzn_p_freqavec l'argumentdecreasing = TRUE. - Examinez les 5 premiers bigrammes avec
term_frequency[1:5]. - Vous pourriez être surpris de voir « fast paced » parmi les principaux termes, car cela peut être négatif et lié aux « long hours ». Examinez les termes les plus associés à « fast paced ». Utilisez
findAssocs()suramzn_p_tdmpour analyser"fast paced"avec un seuil de0.2.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___