Začněte nyníZačněte zdarma

Vytvoření korpusů na základě polarity

V tomto cvičení provedeš krok 3 pracovního postupu při dolování textu. Ačkoli qdap není tidy balíček, použiješ mutate() k vytvoření nového sloupce na základě vráceného seznamu polarity, který reprezentuje všechny hodnoty polarity (to je mimochodem nápověda). Ve třetí kapitole jsme použili vlastní funkci pol_subsections, která pracuje pouze se základními funkcemi R. V tomto cvičení ale dodržujeme tidy principy – využijeme filter() a navíc si představíme pull(). Funkce pull() funguje podobně jako [[ a slouží k extrakci jedné proměnné.

Po rozdělení sloučíš všechny pozitivní a negativní komentáře do dvou větších dokumentů, které budou reprezentovat všechna slova z kladných a záporných recenzí ubytování.

Nakonec vytvoříš Term Document Matrix (TDM) váženou metodou TF-IDF (Term Frequency Inverse Document Frequency). Protože kód v tomto cvičení vychází z tidy struktury, jsou některé funkce z balíčku tm kombinovány s operátorem %>%, aby byl styl konzistentní. Pokud základy balíčku tm neznáš, podívej se na kurz Text Mining with Bag-of-Words in R. Místo počítání četnosti výskytů slov jsou hodnoty v TDM penalizovány za příliš frekventované výrazy – to pomáhá omezit neinformativní slova.

Toto cvičení je součástí kurzu

Sentiment Analysis in R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Upravit a spustit kód