Le merveilleux lexique NRC
Pour finir, vous allez travailler avec le lexique NRC, qui annote les mots selon plusieurs états émotionnels. Vous vous souvenez de la roue des émotions de Plutchik ? Le lexique NRC étiquette les mots selon les 8 émotions de Plutchik, plus positif/négatif.
Dans cet exercice, vous allez découvrir un nouvel opérateur, %in%, qui teste l'appartenance des éléments d'un vecteur à un autre. Dans le code ci-dessous, %in% renverra FALSE, FALSE, TRUE. Cela vient du fait que, dans some_vec, 1 et 2 ne se trouvent pas dans some_other_vector, alors que 3 y apparaît et renvoie TRUE. L'opérateur %in% est donc utile pour repérer des correspondances.
some_vec <- c(1, 2, 3)
some_other_vector <- c(3, "a", "b")
some_vec %in% some_other_vector
Un autre nouvel opérateur est !. Pour les conditions logiques, ajouter ! inverse le résultat. Dans l'exemple ci-dessus, les valeurs FALSE, FALSE, TRUE deviennent TRUE, TRUE, FALSE. Utilisé conjointement avec %in%, il inverse la réponse et sert à retirer les éléments qui correspondent.
!some_vec %in% some_other_vector
Nous avons créé oz, une version tidy du texte The Wizard of Oz, ainsi que nrc, qui contient le lexique « NRC » avec des colonnes renommées.
Cet exercice fait partie du cours
<cours>Analyse de sentiments en R</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
oz_plutchik <- oz %>%
# Join to nrc lexicon by term = word
inner_join(___, by = ___("___" = "___")) %>%
# Only consider Plutchik sentiments
___(!___ %in% c("___", "___")) %>%
# Group by sentiment
___(___) %>%
# Get total count by sentiment
___(total_count = ___(___))