Zacznij terazZacznij za darmo

Najczęstsze terminy z qdap

Jeśli nie zależy ci na pełnej kontroli nad krokami przetwarzania wstępnego, szybkim sposobem na znalezienie najczęstszych terminów jest funkcja freq_terms() z pakietu qdap.

Funkcja przyjmuje zmienną tekstową – w naszym przypadku jest to wektor tweets$text. Możesz określić liczbę wyświetlanych terminów za pomocą argumentu top, wektor słów stopu do usunięcia za pomocą argumentu stopwords, a minimalną liczbę znaków słowa za pomocą argumentu at.least. Pakiet qdap posiada własną listę słów stopu, która różni się od tej z pakietu tm. W tym ćwiczeniu zobaczysz, jak korzystać z obu list i porównać ich wyniki.

Wizualizacja wyników jest prosta – wywołaj funkcję plot() na obiekcie zwróconym przez freq_terms().

To ćwiczenie jest częścią kursu

Eksploracja tekstu metodą Bag-of-Words w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create frequency
frequency <- ___(
  ___, 
  top = ___, 
  at.least = ___, 
  stopwords = ___
)

# Make a frequency bar chart
Edytuj i uruchom kod