Słowa stopu i chmury słów
Skoro jesteś już w trybie eksploracji tekstu, czas zagłębić się w temat. W poprzedniej chmurze słów dominowało słowo „chardonnay" – tak bardzo, że trudno było dostrzec inne interesujące wnioski.
Zmieńmy listę słów stopu i dodajmy do niej „chardonnay", żeby sprawdzić, jakie inne słowa są częste, lecz wcześniej ginęły w tle.
W obszarze roboczym masz już oczyszczoną wersję tweetów o chardonnay. Teraz usuniemy kilka mało znaczących słów. W tym ćwiczeniu użyjemy funkcji content(), aby wyświetlić konkretny tweet do porównania. Pamiętaj o podwójnych nawiasach kwadratowych podczas indeksowania listy korpusu.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Zastosuj
content()do 24. dokumentu wchardonnay_corp. - Dodaj
"chardonnay"do angielskich słów stopu i przypisz wynik dostops. - Sprawdź ostatnie sześć słów w
stops. - Utwórz
cleaned_chardonnay_corpza pomocątm_map(), przekazując kolejno:chardonnay_corp, funkcjęremoveWords()i listę słów stopustops. - Wyświetl ponownie zawartość (
content) 24. tweetu i porównaj wyniki.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])