Transformă vectorul într-un obiect VCorpus (1)
Reamintește-ți că ai încărcat datele text ca vector numit coffee_tweets în exercițiul anterior. Următorul pas este să convertești acest vector cu date text într-un corpus. Așa cum ai aflat din video, un corpus este o colecție de documente – și este important să știi că, în domeniul pachetului tm, R îl recunoaște ca tip de date.
Există două tipuri de corpus: corpus permanent, PCorpus, și corpus volatil, VCorpus. Diferența dintre ele ține de modul în care colecția de documente este stocată pe calculator. În acest curs vom folosi corpusul volatil, care este păstrat în memoria RAM a calculatorului tău, nu salvat pe disc – astfel gestionăm memoria mai eficient.
Pentru a crea un corpus volatil, R trebuie să interpreteze fiecare element din vectorul nostru de text, coffee_tweets, ca pe un document. Pachetul tm pune la dispoziție funcții numite Source exact pentru asta! În acest exercițiu vom folosi funcția VectorSource(), deoarece datele noastre text se află într-un vector. Rezultatul acestei funcții se numește obiect Source. Hai să încerci!
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Încarcă pachetul
tm. - Creează un obiect Source din vectorul
coffee_tweets. Numește noul obiectcoffee_source.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load tm
___
# Make a vector source from coffee_tweets
___