Vytvoř tidy text tibble!
Teď, když znáš principy tidy dat, tento kód ti pomůže uspořádat data do tibble, se kterým pak můžeš pracovat v rámci tidyverse!
Dříve sis ukázal/a, že použití tidy() na objekt TermDocumentMatrix() převede TDM na tibble. V tomto cvičení vytvoříš slovní data přímo ze sloupce s recenzemi comments.
Nejprve použiješ unnest_tokens(), aby se text převedl na malá písmena a recenze se tokenizovaly na jednotlivá slova.
Někdy se hodí zachytit původní pořadí slov v každé skupině korpusu. K tomu použij mutate(). Uvnitř mutate() použiješ seq_along(), která vytvoří posloupnost čísel od 1 do délky objektu – tím zachytíš pořadí slov přesně tak, jak byla napsána.
V balíčku tm bys k odstranění stopwords použil/a removeWords(). V tidyverse nejprve načteš lexikon stopwords a pak použiješ anti_join() mezi tidy textovým datovým rámcem a stopwords.
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Pokyny k cvičení
- Vytvoř
tidy_reviewstak, že původní objekt s recenzemibos_reviewspropojíš (%>%) s funkcíunnest_tokens(). Předej název nového sloupceworda deklaruj sloupeccomments. Pamatuj, že v tidyverse nepotřebuješ$ani uvozovky. - Vytvoř novou proměnnou tidy způsobem! Přepiš
tidy_reviewstak, žetidy_reviewspropojíš sgroup_bypodle sloupceid. Pak to opět přes%>%předej domutate(). Uvnitř mutate vytvoř novou proměnnouoriginal_word_orderrovnouseq_along(word). - Vypiš tibble
tidy_reviews. - Načti předpřipravený lexikon stopwords „SMART" do své R session příkazem
data("stop_words"). - Přepiš
tidy_reviewstak, že původnítidy_reviewspropojíš přes%>%santi_join(). Uvnitřanti_join()předej předpřipravený lexikonstop_words.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Vector to tibble
tidy_reviews <- bos_reviews %>%
___(___, ___)
# Group by and mutate
tidy_reviews <- tidy_reviews %>%
___(___) %>%
___(original_word_order = ___(___))
# Quick review
___
# Load stopwords
___
# Perform anti-join
tidy_reviews_without_stopwords <- tidy_reviews %>%
___(___)