Bing tidy polarita: Count & pivot na bílou velrybu
V tomto cvičení použiješ další inner_join() s lexikonem "bing".
Výsledky pak upravíš pomocí count() z balíčku dplyr a pivot_wider() z balíčku tidyr, abys lépe porozuměl/a textu.
Funkce pivot_wider() rozloží data do více sloupců. V tomto případě sentiment a odpovídající hodnoty n vyjadřují četnost pozitivních nebo negativních výrazů pro každý řádek. Použití pivot_wider() data přetransformuje tak, že každý řádek bude mít hodnoty pro pozitivní i negativní sentiment – i když jsou nulové.
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Pokyny k cvičení
V tomto cvičení máš v R session objekt m_dick_tidy s knihou Moby Dick a objekt bing s lexikonem, podobně jako v předchozím cvičení.
- Proveď
inner_join()nam_dick_tidyabing.- Stejně jako dříve spoj sloupec
"term"vm_dick_tidyse sloupcem"word"v lexikonu. - Nový objekt pojmenuj
moby_lex_words.
- Stejně jako dříve spoj sloupec
- Vytvoř sloupec
indexjako výsledekas.numeric()aplikovaného nadocument. Použij k tomumutate()z tidyverse. - Vytvoř
moby_counttak, že přepošlešmoby_lex_wordsdocount()s argumentysentiment, index. - Vytvoř
moby_widetak, že přepošlešmoby_countdopivot_wider(), kdenames_fromodpovídá sloupcisentiment,values_fromodpovídá sloupcina chybějící hodnoty se doplní pomocívalues_fill = 0. - Jako další pipe použij
arrangek seřazení řádků podle hodnotindex
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Inner join
moby_lex_words <- inner_join(___, ___, by = c("___" = "___"))
moby_lex_words <- moby_lex_words %>%
# Set index to numeric document
mutate(___ = as.numeric(___))
moby_count <- moby_lex_words %>%
# Count by sentiment, index
___(___, ___)
# Examine the counts
moby_count
moby_wide <- moby_count %>%
# Pivot the sentiments
pivot_wider(names_from = ___, values_from = ___, values_fill = ___) %>%
arrange(index)
# Review the pivoted data
moby_wide