Numărarea tipurilor de utilizatori
Numărătorile sunt rezumatul esențial pentru datele categorice. Deoarece textul este un tip de date categorice, este important să te obișnuiești cu calcularea frecvențelor. Setul de date twitter_data conține atât reclamații, cât și mesaje care nu sunt reclamații, indicate de coloana complaint_label, și include și o coloană care arată dacă utilizatorul este verificat (adică identitatea sa a fost confirmată de Twitter), numită usr_verified. Reține că această coloană este de tipul <lgl>, adică logic. Oare utilizatorii verificați se plâng mai des?
Acest exercițiu face parte din cursul
Introducere în analiza textului în R
Instrucțiuni pentru exercițiu
- Încarcă pachetul
tidyverse, care includedplyrșiggplot2. - Filtrează datele pentru a păstra doar tweet-urile care sunt reclamații.
- Numără utilizatorii verificați și pe cei neverificați care au depus reclamații.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the tidyverse package
___(___)
twitter_data %>%
# Filter for just the complaints
___(___) %>%
# Count the number of verified and non-verified users
___(___)