Počítání typů uživatelů
Počty jsou základním způsobem shrnutí kategorických dat. Protože text je kategorická data, je důležité umět počty rychle spočítat. Dataset twitter_data obsahuje stížnosti i nestížnosti, jak ukazuje sloupec complaint_label, a také sloupec s informací o tom, zda je uživatel ověřený (tj. Twitter potvrdil jeho identitu) – sloupec usr_verified. Všimni si, že tento sloupec je typu <lgl>, tedy logický. Stěžují si ověření uživatelé více?
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Načti balíček
tidyverse, který obsahujedplyriggplot2. - Vyfiltruj data tak, aby zůstaly jen tweety, které jsou stížnostmi.
- Spočítej, kolik ověřených a neověřených uživatelů si stěžovalo.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the tidyverse package
___(___)
twitter_data %>%
# Filter for just the complaints
___(___) %>%
# Count the number of verified and non-verified users
___(___)