Construiește un corpus și convertește la litere mici
Un corpus este o listă de documente text. Trebuie să convertești textul tweet-urilor într-un corpus pentru a facilita pașii următori de procesare a textului.
Atunci când analizezi text, vrei să te asiguri că un cuvânt nu este contorizat ca două cuvinte diferite din cauza diferenței de majuscule/minuscule. Prin urmare, trebuie să convertești textul la litere mici.
În acest exercițiu, vei crea un corpus text și vei converti toate caracterele la litere mici.
Rezultatul textului curățat din exercițiul anterior a fost preîncărcat ca twts_gsub.
Biblioteca tm a fost preîncărcată pentru acest exercițiu.
Acest exercițiu face parte din cursul
Analiza datelor din social media în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Convert text in "twt_gsub" dataset to a text corpus and view output
twt_corpus <- twt_gsub %>%
___() %>%
___()
head(twt_corpus$___)