ÎncepețiÎncepe gratuit

Cuvinte de oprire și nori de cuvinte

Acum că ești în modul text mining și savurezi un pahar de chardonnay, e momentul să mergem mai adânc. În ultimul nor de cuvinte, „chardonnay" domina vizualul – atât de mult, încât celelalte informații interesante au rămas în umbră.

Hai să adăugăm „chardonnay" la lista de cuvinte de oprire și să vedem ce alte cuvinte sunt frecvente, dar au fost înainte eclipsate.

În spațiul de lucru ai o versiune curățată a tweet-urilor despre chardonnay. Acum să eliminăm câțiva termeni care nu aduc informații utile. Exercițiul folosește content() pentru a-ți arăta un tweet specific, pentru comparație. Nu uita să folosești parantezele duble pentru a indexa lista corpus.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Aplică content() celui de-al 24-lea document din chardonnay_corp.
  • Adaugă "chardonnay" la cuvintele de oprire în engleză și atribuie rezultatul variabilei stops.
  • Examinează ultimele șase cuvinte din stops.
  • Creează cleaned_chardonnay_corp cu tm_map(), pasând chardonnay_corp, funcția removeWords() și, în final, cuvintele de oprire, stops.
  • Examinează din nou content-ul tweet-ului 24 pentru a compara rezultatele.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Review a "cleaned" tweet
___(___)

# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')

# Review last 6 stopwords 
tail(stops)

# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)

# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])
Editează și rulează codul