Wizualizacja słów różniących się między korpusami
Jeśli chcesz zwizualizować słowa, które nie są wspólne dla obu zbiorów, możesz również użyć funkcji comparison.cloud(). Kroki są bardzo podobne, z jedną istotną różnicą.
Podobnie jak podczas wyszukiwania wspólnych słów, zacznij od połączenia tweetów w osobne korpusy i zgrupowania ich w jednym obiekcie VCorpus(). Następnie zastosuj funkcję clean_corpus() i zorganizuj dane w TermDocumentMatrix.
Aby śledzić, które słowa należą do coffee, a które do chardonnay, możesz nadać kolumnom TDM odpowiednie nazwy:
colnames(all_tdm) <- c("chardonnay", "coffee")
Na koniec przekształć obiekt w macierz za pomocą as.matrix(), aby użyć go w comparison.cloud(). Dla każdego osobnego korpusu przekazanego do comparison.cloud() możesz określić kolor, np. colors = c("red", "yellow", "green"), aby sekcje były łatwo rozróżnialne.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
all_corpus jest wczytane do twojego środowiska.
- Utwórz
all_clean, stosując predefiniowaną funkcjęclean_corpusdoall_corpus. - Utwórz
all_tdm– obiektTermDocumentMatrix– na podstawieall_clean. - Użyj
colnames(), aby nadać nazwy poszczególnym korpusom wall_tdm. Nazwij pierwszą kolumnę "coffee", a drugą – "chardonnay". - Utwórz
all_m, przekształcającall_tdmw macierz. - Utwórz wykres
comparison.cloud()na podstawieall_m, ustawiająccolors = c("orange", "blue")imax.words = 50.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)