Vizualizează cuvintele diferite
Să presupunem că vrei să vizualizezi cuvintele care nu sunt comune. Poți face asta tot cu comparison.cloud(), iar pașii sunt foarte asemănători – cu o singură diferență importantă.
Ca și atunci când căutai cuvintele comune, începi prin a unifica tweet-urile în corpusuri distincte și a le combina într-un singur obiect VCorpus(). Apoi aplici funcția clean_corpus() și organizezi rezultatul într-un TermDocumentMatrix.
Pentru a ține evidența cuvintelor care aparțin lui coffee față de chardonnay, poți seta numele coloanelor din TDM astfel:
colnames(all_tdm) <- c("chardonnay", "coffee")
În final, convertește obiectul într-o matrice cu as.matrix(), pentru a-l putea folosi în comparison.cloud(). Pentru fiecare corpus distinct transmis lui comparison.cloud(), poți specifica o culoare – de exemplu, colors = c("red", "yellow", "green") – astfel încât secțiunile să fie ușor de distins.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
all_corpus este preîncărcat în spațiul tău de lucru.
- Creează
all_cleanaplicând funcția predefinităclean_corpusasupra luiall_corpus. - Creează
all_tdm, unTermDocumentMatrix, dinall_clean. - Folosește
colnames()pentru a redenumi fiecare corpus distinct dinall_tdm. Numește prima coloană "coffee" și a doua coloană "chardonnay". - Creează
all_mconvertindall_tdmîn format de matrice. - Creează un
comparison.cloud()folosindall_m, cucolors = c("orange", "blue")șimax.words = 50.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)