Starcie tytanów! Amazon kontra Google – pozytywne recenzje
Pozytywne recenzje Amazona zawierają bigramy takie jak "good benefits", natomiast negatywne skupiają się na "workload" i problemach z "work-life balance".
Z kolei pozytywne recenzje Google'a wspominają m.in. "great food", "perks", "smart people" i "fun culture". Negatywne dotyczą "politics", "getting big", "bureaucracy" i "middle management".
Postanawiasz stworzyć wykres piramidowy, który zestawia pozytywne recenzje Amazona i Google'a, aby porównać różnice w wspólnych bigramach.
Wstępnie załadowaliśmy ramkę danych all_tdm_df, zawierającą kolumny terms oraz odpowiadające im częstości bigramów AmazonPro i GooglePro. Na jej podstawie wyłonisz 5 bigramów, które pojawiają się w obu korpusach.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Utwórz
common_wordszall_tdm_df, używając funkcjidplyr.- Zastosuj
filter()na kolumnieAmazonPro, aby zachować tylko wartości niezerowe. - Podobnie odfiltruj kolumnę
GooglePropod kątem wartości niezerowych. - Następnie użyj
mutate(), aby dodać nową kolumnędiffzawierającą wartośćabs(bezwzględną) różnicy między częstościami bigramów.
- Zastosuj
- Przekaż
common_wordsprzez pipe doslice_max, aby utworzyćtop5_df– odwołaj się do kolumnydiffi wybierz5największych wartości. Wynik pojawi się w konsoli. - Utwórz
pyramid.plot, przekazując kolejnotop5_df$AmazonPro,top5_df$GooglePro, a następnie dodając etykiety ztop5_df$terms.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Filter to words in common and create an absolute diff column
common_words <- all_tdm_df %>%
filter(
___ != 0,
___ != 0
) %>%
___(diff = ___(___ - ___))
# Extract top 5 common bigrams
(top5_df <- common_words %>% ___(___, n = ___))
# Create the pyramid plot
pyramid.plot(top5_df$___, top5_df$___,
labels = top5_df$___, gap = 12,
top.labels = c("Amzn", "Pro Words", "Goog"),
main = "Words in Common", unit = NULL)