Souboj! Kladné recenze Amazonu vs. Googlu
Kladné recenze Amazonu zmiňují bigramy jako „good benefits", zatímco záporné se soustředí na témata jako „workload" nebo problémy s „work-life balance".
Google naproti tomu sklízí v kladných recenzích pochvaly za „great food", „perks", „smart people" nebo „fun culture". Záporné recenze se pak točí kolem „politics", „getting big", „bureaucracy" a „middle management".
Rozhodneš se sestavit pyramid plot, který postaví kladné recenze Amazonu a Googlu vedle sebe a ukáže rozdíly ve sdílených bigramech.
Máme pro tebe předpřipravený datový rámec all_tdm_df s hodnotami terms a odpovídajícími frekvencemi bigramů AmazonPro a GooglePro. Pomocí tohoto datového rámce identifikuješ 5 nejčastějších bigramů, které se vyskytují v obou korpusech.
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Vytvoř
common_wordsz datového rámceall_tdm_dfpomocí funkcídplyr.- Pomocí
filter()vyfiltruj sloupecAmazonProtak, aby neobsahoval nulové hodnoty. - Stejným způsobem vyfiltruj sloupec
GooglePropro nenulové hodnoty. - Poté pomocí
mutate()přidej nový sloupecdiff, který bude obsahovatabs(absolutní) rozdíl mezi sloupci s frekvencemi termínů.
- Pomocí
- Piped
common_wordsdo funkceslice_max, čímž vytvoříštop5_dfodkazující na sloupecdiffa top5hodnot. Výsledek se ti vypíše do konzole. - Vytvoř
pyramid.plot– předej mutop5_df$AmazonPro, paktop5_df$GoogleProa nakonec přidej popisky pomocítop5_df$terms.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Filter to words in common and create an absolute diff column
common_words <- all_tdm_df %>%
filter(
___ != 0,
___ != 0
) %>%
___(diff = ___(___ - ___))
# Extract top 5 common bigrams
(top5_df <- common_words %>% ___(___, n = ___))
# Create the pyramid plot
pyramid.plot(top5_df$___, top5_df$___,
labels = top5_df$___, gap = 12,
top.labels = c("Amzn", "Pro Words", "Goog"),
main = "Words in Common", unit = NULL)