Zacznij terazZacznij za darmo

Spolaryzowana chmura tagów

Chmury podobieństw pokazują słowa wspólne dla różnych dokumentów. Nie pozwalają jednak zobaczyć, które z tych słów częściej pojawiają się w jednym dokumencie niż w drugim. Do tego celu służy wykres piramidalny – można go wygenerować za pomocą pyramid.plot() z pakietu plotrix.

Na początku trzeba odpowiednio przetworzyć dane. Najprościej zrobić to, konwertując je do ramki danych i korzystając z dplyr. Na podstawie macierzy liczby wystąpień słów, utworzonej przez as.matrix(tdm), należy uzyskać ramkę danych z trzema kolumnami:

  • Słowa zawarte w każdym dokumencie.
  • Liczba wystąpień tych słów w dokumencie 1.
  • Liczba wystąpień tych słów w dokumencie 2.

Następnie wywołaj pyramid.plot() w następujący sposób:

pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)

Dostępne są też dodatkowe argumenty pozwalające poprawić wygląd wykresu.

Teraz przeanalizujesz słowa, które często pojawiają się w tweetach o chardonnay, ale rzadko w tweetach o kawie. Zbiór all_dtm_m jest już dla ciebie przygotowany.

To ćwiczenie jest częścią kursu

Eksploracja tekstu metodą Bag-of-Words w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

top25_df <- all_tdm_m %>%
  # Convert to data frame
  as_tibble(rownames = "___") %>% 
  # Keep rows where word appears everywhere
  filter(if_all(everything(), ___) %>% 
  # Get difference in counts
  mutate(difference = ___) %>% 
  # Keep rows with biggest difference
  slice_max(___,  n = ___) %>% 
  # Arrange by descending difference
  arrange(___(___))
Edytuj i uruchom kod