ÎncepețiÎncepe gratuit

Construiește un corpus și convertește la litere mici

Un corpus este o listă de documente text. Trebuie să convertești textul tweet-urilor într-un corpus pentru a facilita pașii următori de procesare a textului.

Atunci când analizezi text, vrei să te asiguri că un cuvânt nu este contorizat ca două cuvinte diferite din cauza diferenței de majuscule/minuscule. Prin urmare, trebuie să convertești textul la litere mici.

În acest exercițiu, vei crea un corpus text și vei converti toate caracterele la litere mici.

Rezultatul textului curățat din exercițiul anterior a fost preîncărcat ca twts_gsub.

Biblioteca tm a fost preîncărcată pentru acest exercițiu.

Acest exercițiu face parte din cursul

Analiza datelor din social media în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Convert text in "twt_gsub" dataset to a text corpus and view output
twt_corpus <- twt_gsub %>% 
                ___() %>% 
                ___() 
head(twt_corpus$___)
Editează și rulează codul