Cum influențează bigramele norii de cuvinte?
Acum că ai creat un DTM cu bigrame, îl poți examina și recrea un nor de cuvinte. Noua metodă de tokenizare influențează nu doar matricele, ci și orice vizualizare sau model bazat pe acestea.
Îți amintești că "Marvin" și "Gaye" erau termeni separați în norul de cuvinte pentru chardonnay? Folosind tokenizarea cu bigrame, sunt capturate toate combinațiile de două cuvinte. Observă ce se întâmplă cu norul de cuvinte în acest exercițiu.
Acest exercițiu folosește str_subset din stringr. Reține că alte cursuri DataCamp acoperă expresiile regulate în mai mult detaliu. Ca memento, expresia regulată ^ marchează poziția de început în bigramele exercițiului.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
Tweet-urile despre chardonnay au fost curățate și organizate într-un DTM numit bigram_dtm.
- Creează
bigram_dtm_mconvertindbigram_dtmîntr-o matrice. - Creează un obiect
freqcu frecvențele cuvintelor, aplicândcolSums()pebigram_dtm_m. - Extrage vectorul de caractere al combinațiilor de cuvinte cu
names(freq)și atribuie rezultatul luibi_words. - Transmite
bi_wordscătrestr_subset()cu modelul de potrivire"^marvin"pentru a examina toate bigramele care încep cu "marvin". - Trasează un
wordcloud()simplu, transmițândbi_words,freqșimax.words = 15în funcție.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create bigram_dtm_m
___ <- ___(___)
# Create freq
___ <- ___(___)
# Create bi_words
___ <- ___(___)
# Examine part of bi_words
___(___, ___)
# Plot a word cloud
___(___, ___, ___)