ÎncepețiÎncepe gratuit

Transformă vectorul într-un obiect VCorpus (1)

Reamintește-ți că ai încărcat datele text ca vector numit coffee_tweets în exercițiul anterior. Următorul pas este să convertești acest vector cu date text într-un corpus. Așa cum ai aflat din video, un corpus este o colecție de documente – și este important să știi că, în domeniul pachetului tm, R îl recunoaște ca tip de date.

Există două tipuri de corpus: corpus permanent, PCorpus, și corpus volatil, VCorpus. Diferența dintre ele ține de modul în care colecția de documente este stocată pe calculator. În acest curs vom folosi corpusul volatil, care este păstrat în memoria RAM a calculatorului tău, nu salvat pe disc – astfel gestionăm memoria mai eficient.

Pentru a crea un corpus volatil, R trebuie să interpreteze fiecare element din vectorul nostru de text, coffee_tweets, ca pe un document. Pachetul tm pune la dispoziție funcții numite Source exact pentru asta! În acest exercițiu vom folosi funcția VectorSource(), deoarece datele noastre text se află într-un vector. Rezultatul acestei funcții se numește obiect Source. Hai să încerci!

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă pachetul tm.
  • Creează un obiect Source din vectorul coffee_tweets. Numește noul obiect coffee_source.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load tm
___

# Make a vector source from coffee_tweets
___
Editează și rulează codul