Totul despre cuvintele de ignorat (stop words)
Există adesea cuvinte frecvente care nu aduc informații utile. Acestea se numesc stop words (cuvinte de ignorat) și, de obicei, este indicat să le elimini din analiză. Câteva exemple comune în engleză sunt „I", „she'll", „the" etc. Pachetul tm include 174 astfel de cuvinte (le vei afișa în acest exercițiu!)
În funcție de analiza pe care o faci, s-ar putea să fie nevoie să extinzi această listă. În exemplul nostru cu tweet-uri despre cafea, toate tweet-urile conțin cuvântul „coffee", așa că este important să îl eliminăm pe lângă stop words-urile standard. Dacă lăsăm „coffee" în text, nu adăugăm nicio informație relevantă, iar cuvântul va fi suprareprezent într-o analiză de frecvență.
Funcția c() îți permite să adaugi cuvinte noi la lista de stop words. De exemplu, codul de mai jos adaugă „word1" și „word2" la lista implicită de stop words în engleză:
all_stops <- c("word1", "word2", stopwords("en"))
Odată ce ai o listă de stop words potrivită, folosești funcția removeWords() aplicată pe text. removeWords() primește două argumente: obiectul text din care se elimină cuvintele și lista cuvintelor de eliminat.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Afișează stop words-urile standard apelând
stopwords("en"). - Elimină stop words-urile „en" din
text. - Adaugă „coffee" și „bean" la stop words-urile standard și atribuie rezultatul variabilei
new_stops. - Elimină stop words-urile personalizate,
new_stops, dintext.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
## text is preloaded into your workspace
# List standard English stop words
___
# Print text without standard stop words
removeWords(___, ___("___"))
# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)
# Remove stop words from text
___