Jak bigramy wpływają na chmury słów?
Masz już DTM oparty na bigramach – możesz go teraz zbadać i utworzyć nową chmurę słów. Nowy sposób tokenizacji wpływa nie tylko na macierze, ale też na wszelkie wizualizacje i modele zbudowane na ich podstawie.
Pamiętasz, że w chmurze słów dla chardonnay „Marvin" i „Gaye" były osobnymi terminami? Tokenizacja bigramowa łączy wszystkie kombinacje dwóch sąsiadujących słów. Sprawdź, co się stanie z chmurą słów w tym ćwiczeniu.
Ćwiczenie korzysta z funkcji str_subset z pakietu stringr. Pamiętaj, że inne kursy DataCamp omawiają wyrażenia regularne bardziej szczegółowo. Dla przypomnienia: wyrażenie regularne ^ dopasowuje początkową pozycję w bigrama z tego ćwiczenia.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
Tweety o chardonnay zostały oczyszczone i zapisane w DTM o nazwie bigram_dtm.
- Utwórz obiekt
bigram_dtm_m, konwertującbigram_dtmna macierz. - Utwórz obiekt
freqzawierający częstości słów, stosując funkcjęcolSums()nabigram_dtm_m. - Wyodrębnij wektor tekstowy kombinacji słów za pomocą
names(freq)i przypisz wynik do zmiennejbi_words. - Przekaż
bi_wordsdo funkcjistr_subset()ze wzorcem dopasowania"^marvin", aby wyświetlić wszystkie bigramy zaczynające się od „marvin". - Narysuj prostą chmurę słów za pomocą
wordcloud(), przekazując do funkcjibi_words,freqorazmax.words = 15.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create bigram_dtm_m
___ <- ___(___)
# Create freq
___ <- ___(___)
# Create bi_words
___ <- ___(___)
# Examine part of bi_words
___(___, ___)
# Plot a word cloud
___(___, ___, ___)