Ta bort stoppord och extra mellanslag
Ett textkorpus innehåller vanligtvis många vanliga ord som "a", "an", "the", "of" och "but". Inom naturlig språkbehandling kallas dessa för stoppord.
Stoppord tas normalt bort under textbearbetningen så att man kan fokusera på viktigare ord i korpuset för att utvinna insikter.
Dessutom behöver de extra mellanslag som uppstår när specialtecken, interpunktion, siffror och stoppord tas bort också rensas bort från korpuset.
Korpuset som du skapade i föregående övning har laddats in i förväg som twt_corpus_lwr.
Biblioteket tm har laddats in i förväg för den här övningen.
Den här övningen är en del av kursen
Analysera data från sociala medier i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)