Compter les types d'utilisateurs
Les dénombrements sont le résumé de base pour les données catégorielles. Comme le texte est catégoriel, il est important d'être à l'aise avec le calcul des comptes. Le jeu de données twitter_data contient des plaintes et des non-plaintes, tel qu'indiqué par la colonne complaint_label, et comprend aussi une colonne indiquant si l'utilisateur est vérifié ou non (c.-à-d. confirmé par Twitter comme étant bien la personne qu'il prétend être), appelée usr_verified. Notez que cette colonne est de type <lgl>, c'est‑à‑dire logique. Les utilisateurs vérifiés se plaignent‑ils davantage ?
Cette activité fait partie du cours
Introduction à l'analyse de texte en R
Instructions de l’exercice
- Chargez le paquet
tidyverse, qui inclutdplyretggplot2. - Filtrez les données pour ne conserver que les tweets qui sont des plaintes.
- Comptez le nombre d'utilisateurs vérifiés et non vérifiés qui ont porté plainte.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the tidyverse package
___(___)
twitter_data %>%
# Filter for just the complaints
___(___) %>%
# Count the number of verified and non-verified users
___(___)