Zacznij terazZacznij za darmo

Usuń stop words i dodatkowe spacje

Korpus tekstu zazwyczaj zawiera wiele popularnych słów, takich jak "a", "an", "the", "of" czy "but". W przetwarzaniu języka naturalnego nazywamy je stop words.

Stop words są zwykle usuwane podczas przetwarzania tekstu, aby skupić się na ważniejszych słowach w korpusie i wyciągać z nich wnioski.

Po usunięciu znaków specjalnych, interpunkcji, cyfr i stop words w korpusie mogą pojawić się dodatkowe spacje – trzeba je również usunąć.

Korpus utworzony w poprzednim ćwiczeniu został wczytany jako twt_corpus_lwr.

Biblioteka tm jest już wczytana dla tego ćwiczenia.

To ćwiczenie jest częścią kursu

Analiza danych z mediów społecznościowych w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Edytuj i uruchom kod