Recapitulare TM (I)
În cursul Text Mining: Bag of Words ai învățat că un corpus este o colecție de texte și ai studiat câteva funcții pentru preprocesarea textului. Ca recapitulare, o modalitate de a crea și curăța un corpus este cu ajutorul funcțiilor de mai jos. Chiar dacă acesta este un curs diferit, analiza de sentiment face parte din text mining, deci o recapitulare poate fi de folos.
- Transformă un vector de caractere într-o sursă de text folosind
VectorSource(). - Transformă o sursă de text într-un corpus folosind
VCorpus(). - Elimină caracterele nedorite din corpus folosind funcții de curățare precum
removePunctuation()șistripWhitespace()dintm, șireplace_abbreviation()dinqdap.
În acest exercițiu, o funcție personalizată clean_corpus() a fost creată folosind funcții standard de preprocesare, pentru o aplicare mai ușoară.
clean_corpus() acceptă rezultatul funcției VCorpus() și aplică funcții de curățare. De exemplu:
processed_corpus <- clean_corpus(my_corpus)
Acest exercițiu face parte din cursul
Analiza sentimentelor în R
Instrucțiuni pentru exercițiu
Sesiunea ta R conține un vector de text, tm_define, cu două documente mici și funcția clean_corpus().
- Creează un obiect numit
tm_vectoraplicândVectorSource()petm_define. - Creează
tm_corpusfolosindVCorpus()petm_vector. - Folosește
content()pentru a examina conținutul primului document dintm_corpus.- Documentele din corpus sunt accesate folosind sintaxa de listă, deci folosește paranteze pătrate duble, de exemplu
[[1]].
- Documentele din corpus sunt accesate folosind sintaxa de listă, deci folosește paranteze pătrate duble, de exemplu
- Curăță textul corpusului folosind funcția personalizată
clean_corpus()petm_corpus. Numește acest nou obiecttm_clean. - Examinează primul document al noului obiect
tm_cleanpentru a vedea cum s-a modificat textul după aplicarea funcțieiclean_corpus().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___