Polaritate tidy Bing: Numără și pivotează balena albă
În acest exercițiu vei aplica un nou inner_join() folosind lexiconul "bing".
Apoi vei manipula rezultatele cu count() din dplyr și cu pivot_wider() din tidyr, pentru a extrage informații din text.
Funcția pivot_wider() distribuie datele pe mai multe coloane. În acest caz, sentimentul și valorile n corespunzătoare reprezintă frecvența termenilor pozitivi sau negativi pentru fiecare linie. Folosind pivot_wider(), datele sunt restructurate astfel încât fiecare rând să conțină valori pozitive și negative, chiar dacă acestea sunt 0.
Acest exercițiu face parte din cursul
Analiza sentimentelor în R
Instrucțiuni pentru exercițiu
În acest exercițiu, sesiunea R conține m_dick_tidy, care include cartea Moby Dick, și bing, cu lexiconul similar exercițiului anterior.
- Realizează un
inner_join()întrem_dick_tidyșibing.- Ca și înainte, unește coloana
"term"dinm_dick_tidycu coloana"word"din lexicon. - Salvează noul obiect cu numele
moby_lex_words.
- Ca și înainte, unește coloana
- Creează o coloană
index, egală cuas.numeric()aplicat pedocument. Aceasta se realizează cumutate()în tidyverse. - Creează
moby_countpasândmoby_lex_wordslacount()cu argumentelesentiment, index. - Generează
moby_widepasândmoby_countlapivot_wider(), undenames_fromeste coloanasentiment,values_fromeste coloanan, iar valorile lipsă sunt completate cuvalues_fill = 0. arrangeeste următorul pipe, folosit pentru a ordona rândurile după valorile dinindex.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Inner join
moby_lex_words <- inner_join(___, ___, by = c("___" = "___"))
moby_lex_words <- moby_lex_words %>%
# Set index to numeric document
mutate(___ = as.numeric(___))
moby_count <- moby_lex_words %>%
# Count by sentiment, index
___(___, ___)
# Examine the counts
moby_count
moby_wide <- moby_count %>%
# Pivot the sentiments
pivot_wider(names_from = ___, values_from = ___, values_fill = ___) %>%
arrange(index)
# Review the pivoted data
moby_wide