Najczęstsze terminy z qdap
Jeśli nie zależy ci na pełnej kontroli nad krokami przetwarzania wstępnego, szybkim sposobem na znalezienie najczęstszych terminów jest funkcja freq_terms() z pakietu qdap.
Funkcja przyjmuje zmienną tekstową – w naszym przypadku jest to wektor tweets$text. Możesz określić liczbę wyświetlanych terminów za pomocą argumentu top, wektor słów stopu do usunięcia za pomocą argumentu stopwords, a minimalną liczbę znaków słowa za pomocą argumentu at.least. Pakiet qdap posiada własną listę słów stopu, która różni się od tej z pakietu tm. W tym ćwiczeniu zobaczysz, jak korzystać z obu list i porównać ich wyniki.
Wizualizacja wyników jest prosta – wywołaj funkcję plot() na obiekcie zwróconym przez freq_terms().
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create frequency
frequency <- ___(
___,
top = ___,
at.least = ___,
stopwords = ___
)
# Make a frequency bar chart