Tworzenie korpusów na podstawie polaryzacji
W tym ćwiczeniu wykonasz krok 3 procesu eksploracji tekstu. Choć qdap nie jest pakietem z rodziny tidy, użyjesz funkcji mutate(), aby dodać nową kolumnę na podstawie listy polarity zawierającej wyniki całkowitej polaryzacji (to podpowiedź). W rozdziale 3 korzystaliśmy z własnej funkcji pol_subsections opartej wyłącznie na podstawowym R. Tutaj, zgodnie z zasadami tidy, używamy filter() oraz wprowadzamy pull(). Funkcja pull() działa podobnie jak [[ – wyodrębnia pojedynczą zmienną.
Po podziale komentarzy łączysz wszystkie pozytywne i negatywne opinie w dwa większe dokumenty, reprezentujące zbiory słów z pozytywnych i negatywnych recenzji wynajmu.
Na koniec utworzysz ważoną metodą TF-IDF (Term Frequency Inverse Document Frequency) macierz Term-Document Matrix (TDM). Ponieważ kod ćwiczenia zaczyna się od struktury tidy, niektóre funkcje z pakietu tm są używane razem z operatorem %>%, aby zachować spójny styl. Jeśli podstawy pakietu tm nie są ci znane, zapoznaj się z kursem Text Mining with Bag-of-Words in R. Zamiast zliczać częstość występowania słów, wartości w TDM są „karane" za nadużywane wyrazy, co pomaga ograniczyć mało informatywne słowa.
To ćwiczenie jest częścią kursu
Analiza sentymentu w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")