ÎncepețiÎncepe gratuit

Recapitulare TM (I)

În cursul Text Mining: Bag of Words ai învățat că un corpus este o colecție de texte și ai studiat câteva funcții pentru preprocesarea textului. Ca recapitulare, o modalitate de a crea și curăța un corpus este cu ajutorul funcțiilor de mai jos. Chiar dacă acesta este un curs diferit, analiza de sentiment face parte din text mining, deci o recapitulare poate fi de folos.

În acest exercițiu, o funcție personalizată clean_corpus() a fost creată folosind funcții standard de preprocesare, pentru o aplicare mai ușoară.

clean_corpus() acceptă rezultatul funcției VCorpus() și aplică funcții de curățare. De exemplu:

processed_corpus <- clean_corpus(my_corpus)

Acest exercițiu face parte din cursul

Analiza sentimentelor în R

Vezi cursul

Instrucțiuni pentru exercițiu

Sesiunea ta R conține un vector de text, tm_define, cu două documente mici și funcția clean_corpus().

  • Creează un obiect numit tm_vector aplicând VectorSource() pe tm_define.
  • Creează tm_corpus folosind VCorpus() pe tm_vector.
  • Folosește content() pentru a examina conținutul primului document din tm_corpus.
    • Documentele din corpus sunt accesate folosind sintaxa de listă, deci folosește paranteze pătrate duble, de exemplu [[1]].
  • Curăță textul corpusului folosind funcția personalizată clean_corpus() pe tm_corpus. Numește acest nou obiect tm_clean.
  • Examinează primul document al noului obiect tm_clean pentru a vedea cum s-a modificat textul după aplicarea funcției clean_corpus().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Editează și rulează codul