ÎncepețiÎncepe gratuit

Cum influențează bigramele norii de cuvinte?

Acum că ai creat un DTM cu bigrame, îl poți examina și recrea un nor de cuvinte. Noua metodă de tokenizare influențează nu doar matricele, ci și orice vizualizare sau model bazat pe acestea.

Îți amintești că "Marvin" și "Gaye" erau termeni separați în norul de cuvinte pentru chardonnay? Folosind tokenizarea cu bigrame, sunt capturate toate combinațiile de două cuvinte. Observă ce se întâmplă cu norul de cuvinte în acest exercițiu.

Acest exercițiu folosește str_subset din stringr. Reține că alte cursuri DataCamp acoperă expresiile regulate în mai mult detaliu. Ca memento, expresia regulată ^ marchează poziția de început în bigramele exercițiului.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Tweet-urile despre chardonnay au fost curățate și organizate într-un DTM numit bigram_dtm.

  • Creează bigram_dtm_m convertind bigram_dtm într-o matrice.
  • Creează un obiect freq cu frecvențele cuvintelor, aplicând colSums() pe bigram_dtm_m.
  • Extrage vectorul de caractere al combinațiilor de cuvinte cu names(freq) și atribuie rezultatul lui bi_words.
  • Transmite bi_words către str_subset() cu modelul de potrivire "^marvin" pentru a examina toate bigramele care încep cu "marvin".
  • Trasează un wordcloud() simplu, transmițând bi_words, freq și max.words = 15 în funcție.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create bigram_dtm_m
___ <- ___(___)

# Create freq
___ <- ___(___)

# Create bi_words
___ <- ___(___)

# Examine part of bi_words
___(___, ___)

# Plot a word cloud
___(___, ___, ___)
Editează și rulează codul