Elimină cuvintele de oprire și spațiile suplimentare
Un corpus de text conține de obicei multe cuvinte comune, precum „a", „an", „the", „of" sau „but". În procesarea limbajului natural, acestea se numesc cuvinte de oprire (stop words).
Cuvintele de oprire sunt, de regulă, eliminate în etapa de preprocesare a textului, pentru a te putea concentra pe cuvintele cu adevărat importante din corpus și a extrage informații relevante.
De asemenea, spațiile suplimentare apărute în urma eliminării caracterelor speciale, a punctuației, a cifrelor și a cuvintelor de oprire trebuie și ele înlăturate din corpus.
Corpusul creat în exercițiul anterior a fost preîncărcat ca twt_corpus_lwr.
Biblioteca tm a fost preîncărcată pentru acest exercițiu.
Acest exercițiu face parte din cursul
Analiza datelor din social media în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)