ÎncepețiÎncepe gratuit

Vizualizează cuvintele diferite

Să presupunem că vrei să vizualizezi cuvintele care nu sunt comune. Poți face asta tot cu comparison.cloud(), iar pașii sunt foarte asemănători – cu o singură diferență importantă.

Ca și atunci când căutai cuvintele comune, începi prin a unifica tweet-urile în corpusuri distincte și a le combina într-un singur obiect VCorpus(). Apoi aplici funcția clean_corpus() și organizezi rezultatul într-un TermDocumentMatrix.

Pentru a ține evidența cuvintelor care aparțin lui coffee față de chardonnay, poți seta numele coloanelor din TDM astfel:

colnames(all_tdm) <- c("chardonnay", "coffee")

În final, convertește obiectul într-o matrice cu as.matrix(), pentru a-l putea folosi în comparison.cloud(). Pentru fiecare corpus distinct transmis lui comparison.cloud(), poți specifica o culoare – de exemplu, colors = c("red", "yellow", "green") – astfel încât secțiunile să fie ușor de distins.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

all_corpus este preîncărcat în spațiul tău de lucru.

  • Creează all_clean aplicând funcția predefinită clean_corpus asupra lui all_corpus.
  • Creează all_tdm, un TermDocumentMatrix, din all_clean.
  • Folosește colnames() pentru a redenumi fiecare corpus distinct din all_tdm. Numește prima coloană "coffee" și a doua coloană "chardonnay".
  • Creează all_m convertind all_tdm în format de matrice.
  • Creează un comparison.cloud() folosind all_m, cu colors = c("orange", "blue") și max.words = 50.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Clean the corpus
___ <- ___(___)

# Create all_tdm
___ <- ___(___)

# Give the columns distinct names
___(___) <- ___

# Create all_m
___ <- ___(___)

# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)
Editează și rulează codul