Skojarzenia słów
Zgodnie z oczekiwaniami w dendrogramie widać podobne tematy. Wracając do pozytywnych komentarzy, postanawiasz przyjrzeć się wyrażeniom, które najczęściej pojawiały się w chmurach słów. Masz nadzieję znaleźć powiązane terminy za pomocą funkcji findAssocs() z pakietu tm. Skoro wiesz już o długich godzinach pracy i braku równowagi między życiem zawodowym a prywatnym, sprawdź, czy coś cię zaskoczy.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
Korpus amzn_pros_corp został wyczyszczony przy użyciu niestandardowych funkcji, tak jak wcześniej.
- Zbuduj TDM o nazwie
amzn_p_tdmna podstawieamzn_pros_corpz parametremcontrol = list(tokenize = tokenizer). - Utwórz
amzn_p_m, konwertującamzn_p_tdmna macierz. - Utwórz
amzn_p_freq, stosującrowSums()doamzn_p_m. - Utwórz
term_frequency, używającsort()naamzn_p_freqz argumentemdecreasing = TRUE. - Wyświetl 5 pierwszych bigramów za pomocą
term_frequency[1:5]. - Możesz być zaskoczony, widząc „fast paced" jako jeden z najczęstszych terminów – może mieć negatywny wydźwięk związany z „długimi godzinami pracy". Sprawdź, jakie terminy są najbardziej skojarzone z „fast paced". Użyj
findAssocs()naamzn_p_tdm, aby zbadać"fast paced"z progiem0.2.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___