ÎncepețiÎncepe gratuit

Elimină cuvintele de oprire și spațiile suplimentare

Un corpus de text conține de obicei multe cuvinte comune, precum „a", „an", „the", „of" sau „but". În procesarea limbajului natural, acestea se numesc cuvinte de oprire (stop words).

Cuvintele de oprire sunt, de regulă, eliminate în etapa de preprocesare a textului, pentru a te putea concentra pe cuvintele cu adevărat importante din corpus și a extrage informații relevante.

De asemenea, spațiile suplimentare apărute în urma eliminării caracterelor speciale, a punctuației, a cifrelor și a cuvintelor de oprire trebuie și ele înlăturate din corpus.

Corpusul creat în exercițiul anterior a fost preîncărcat ca twt_corpus_lwr.

Biblioteca tm a fost preîncărcată pentru acest exercițiu.

Acest exercițiu face parte din cursul

Analiza datelor din social media în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Editează și rulează codul