CommencezCommencez gratuitement

Extraction de caractéristiques et analyse : amzn_cons

Vous décidez maintenant de comparer avec le corpus amzn_cons_corp dans une autre matrice TDM de bigrammes. Évidemment, vous vous attendez à voir des expressions différentes dans votre nuage de mots.

Encore une fois, vous utiliserez cette fonction personnalisée pour extraire vos caractéristiques de bigrammes pour la visualisation :

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Créez amzn_c_tdm en convertissant amzn_cons_corp en TermDocumentMatrix et en intégrant la fonction de bigrammes avec control = list(tokenize = tokenizer).
  • Créez amzn_c_tdm_m comme version matricielle de amzn_c_tdm.
  • Créez amzn_c_freq en utilisant rowSums() pour obtenir les fréquences des termes à partir de amzn_c_tdm_m.
  • Créez un wordcloud() à l'aide de names(amzn_c_freq) et des valeurs amzn_c_freq. Utilisez aussi les arguments max.words = 25 et color = "red".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
Modifier et exécuter le code