Zacznij terazZacznij za darmo

Tworzenie korpusów na podstawie polaryzacji

W tym ćwiczeniu wykonasz krok 3 procesu eksploracji tekstu. Choć qdap nie jest pakietem z rodziny tidy, użyjesz funkcji mutate(), aby dodać nową kolumnę na podstawie listy polarity zawierającej wyniki całkowitej polaryzacji (to podpowiedź). W rozdziale 3 korzystaliśmy z własnej funkcji pol_subsections opartej wyłącznie na podstawowym R. Tutaj, zgodnie z zasadami tidy, używamy filter() oraz wprowadzamy pull(). Funkcja pull() działa podobnie jak [[ – wyodrębnia pojedynczą zmienną.

Po podziale komentarzy łączysz wszystkie pozytywne i negatywne opinie w dwa większe dokumenty, reprezentujące zbiory słów z pozytywnych i negatywnych recenzji wynajmu.

Na koniec utworzysz ważoną metodą TF-IDF (Term Frequency Inverse Document Frequency) macierz Term-Document Matrix (TDM). Ponieważ kod ćwiczenia zaczyna się od struktury tidy, niektóre funkcje z pakietu tm są używane razem z operatorem %>%, aby zachować spójny styl. Jeśli podstawy pakietu tm nie są ci znane, zapoznaj się z kursem Text Mining with Bag-of-Words in R. Zamiast zliczać częstość występowania słów, wartości w TDM są „karane" za nadużywane wyrazy, co pomaga ograniczyć mało informatywne słowa.

To ćwiczenie jest częścią kursu

Analiza sentymentu w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Edytuj i uruchom kod