Usuń stop words i dodatkowe spacje
Korpus tekstu zazwyczaj zawiera wiele popularnych słów, takich jak "a", "an", "the", "of" czy "but". W przetwarzaniu języka naturalnego nazywamy je stop words.
Stop words są zwykle usuwane podczas przetwarzania tekstu, aby skupić się na ważniejszych słowach w korpusie i wyciągać z nich wnioski.
Po usunięciu znaków specjalnych, interpunkcji, cyfr i stop words w korpusie mogą pojawić się dodatkowe spacje – trzeba je również usunąć.
Korpus utworzony w poprzednim ćwiczeniu został wczytany jako twt_corpus_lwr.
Biblioteka tm jest już wczytana dla tego ćwiczenia.
To ćwiczenie jest częścią kursu
Analiza danych z mediów społecznościowych w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)