Cuvinte de oprire și nori de cuvinte
Acum că ești în modul text mining și savurezi un pahar de chardonnay, e momentul să mergem mai adânc. În ultimul nor de cuvinte, „chardonnay" domina vizualul – atât de mult, încât celelalte informații interesante au rămas în umbră.
Hai să adăugăm „chardonnay" la lista de cuvinte de oprire și să vedem ce alte cuvinte sunt frecvente, dar au fost înainte eclipsate.
În spațiul de lucru ai o versiune curățată a tweet-urilor despre chardonnay. Acum să eliminăm câțiva termeni care nu aduc informații utile. Exercițiul folosește content() pentru a-ți arăta un tweet specific, pentru comparație. Nu uita să folosești parantezele duble pentru a indexa lista corpus.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Aplică
content()celui de-al 24-lea document dinchardonnay_corp. - Adaugă
"chardonnay"la cuvintele de oprire în engleză și atribuie rezultatul variabileistops. - Examinează ultimele șase cuvinte din
stops. - Creează
cleaned_chardonnay_corpcutm_map(), pasândchardonnay_corp, funcțiaremoveWords()și, în final, cuvintele de oprire,stops. - Examinează din nou
content-ul tweet-ului24pentru a compara rezultatele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])