ÎncepețiÎncepe gratuit

Nor de etichete polarizat

Norurile de similitudine arată cuvintele comune din mai multe documente. Un lucru interesant pe care nu îl pot evidenția este care dintre acele cuvinte apare mai frecvent într-un document față de altul. Pentru asta, ai nevoie de un pyramid plot; acesta poate fi generat cu pyramid.plot() din pachetul plotrix.

Înainte, datele trebuie pregătite într-un format potrivit. Cel mai simplu mod este să le convertești într-un data frame și să folosești dplyr. Pornind de la o matrice de frecvențe ale cuvintelor, creată cu as.matrix(tdm), trebuie să obții un data frame cu trei coloane:

  • Cuvintele din fiecare document.
  • Frecvențele acelor cuvinte din documentul 1.
  • Frecvențele acelor cuvinte din documentul 2.

Apoi folosești pyramid.plot() astfel:

pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)

Există și câteva argumente suplimentare pentru a îmbunătăți aspectul vizual al graficului.

Acum vei explora cuvintele frecvente în tweet-urile despre chardonnay, dar rare în cele despre cafea. all_dtm_m este deja creat pentru tine.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

top25_df <- all_tdm_m %>%
  # Convert to data frame
  as_tibble(rownames = "___") %>% 
  # Keep rows where word appears everywhere
  filter(if_all(everything(), ___) %>% 
  # Get difference in counts
  mutate(difference = ___) %>% 
  # Keep rows with biggest difference
  slice_max(___,  n = ___) %>% 
  # Arrange by descending difference
  arrange(___(___))
Editează și rulează codul