Spolaryzowana chmura tagów
Chmury podobieństw pokazują słowa wspólne dla różnych dokumentów. Nie pozwalają jednak zobaczyć, które z tych słów częściej pojawiają się w jednym dokumencie niż w drugim. Do tego celu służy wykres piramidalny – można go wygenerować za pomocą pyramid.plot() z pakietu plotrix.
Na początku trzeba odpowiednio przetworzyć dane. Najprościej zrobić to, konwertując je do ramki danych i korzystając z dplyr. Na podstawie macierzy liczby wystąpień słów, utworzonej przez as.matrix(tdm), należy uzyskać ramkę danych z trzema kolumnami:
- Słowa zawarte w każdym dokumencie.
- Liczba wystąpień tych słów w dokumencie 1.
- Liczba wystąpień tych słów w dokumencie 2.
Następnie wywołaj pyramid.plot() w następujący sposób:
pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)
Dostępne są też dodatkowe argumenty pozwalające poprawić wygląd wykresu.
Teraz przeanalizujesz słowa, które często pojawiają się w tweetach o chardonnay, ale rzadko w tweetach o kawie. Zbiór all_dtm_m jest już dla ciebie przygotowany.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
top25_df <- all_tdm_m %>%
# Convert to data frame
as_tibble(rownames = "___") %>%
# Keep rows where word appears everywhere
filter(if_all(everything(), ___) %>%
# Get difference in counts
mutate(difference = ___) %>%
# Keep rows with biggest difference
slice_max(___, n = ___) %>%
# Arrange by descending difference
arrange(___(___))