CommencezCommencez gratuitement

Association de mots

Comme prévu, vous observez des thèmes similaires dans tout le dendrogramme. De retour aux commentaires positifs, vous décidez d'examiner les expressions les plus fréquentes qui sont apparues dans les nuages de mots. Vous espérez trouver des termes associés à l'aide de la fonction findAssocs() de tm. Vous voulez maintenant vérifier s'il y a quelque chose de surprenant, sachant qu'il y a de longues heures de travail et un manque d'équilibre travail‑vie personnelle.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Le corpus amzn_pros_corp a été nettoyé à l'aide des fonctions personnalisées comme auparavant.

  • Construisez une TDM appelée amzn_p_tdm à partir de amzn_pros_corp avec control = list(tokenize = tokenizer).
  • Créez amzn_p_m en convertissant amzn_p_tdm en matrice.
  • Créez amzn_p_freq en appliquant rowSums() à amzn_p_m.
  • Créez term_frequency en appliquant sort() à amzn_p_freq avec l'argument decreasing = TRUE.
  • Examinez les 5 premiers bigrammes avec term_frequency[1:5].
  • Vous pourriez être surpris de voir « fast paced » parmi les principaux termes, car cela peut être négatif et lié aux « long hours ». Examinez les termes les plus associés à « fast paced ». Utilisez findAssocs() sur amzn_p_tdm pour analyser "fast paced" avec un seuil de 0.2.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
Modifier et exécuter le code