Vytvoření korpusů na základě polarity
V tomto cvičení provedeš krok 3 pracovního postupu při dolování textu. Ačkoli qdap není tidy balíček, použiješ mutate() k vytvoření nového sloupce na základě vráceného seznamu polarity, který reprezentuje všechny hodnoty polarity (to je mimochodem nápověda). Ve třetí kapitole jsme použili vlastní funkci pol_subsections, která pracuje pouze se základními funkcemi R. V tomto cvičení ale dodržujeme tidy principy – využijeme filter() a navíc si představíme pull(). Funkce pull() funguje podobně jako [[ a slouží k extrakci jedné proměnné.
Po rozdělení sloučíš všechny pozitivní a negativní komentáře do dvou větších dokumentů, které budou reprezentovat všechna slova z kladných a záporných recenzí ubytování.
Nakonec vytvoříš Term Document Matrix (TDM) váženou metodou TF-IDF (Term Frequency Inverse Document Frequency). Protože kód v tomto cvičení vychází z tidy struktury, jsou některé funkce z balíčku tm kombinovány s operátorem %>%, aby byl styl konzistentní. Pokud základy balíčku tm neznáš, podívej se na kurz Text Mining with Bag-of-Words in R. Místo počítání četnosti výskytů slov jsou hodnoty v TDM penalizovány za příliš frekventované výrazy – to pomáhá omezit neinformativní slova.
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")