Создание DTM
Создайте матрицу документ-термин (DTM) на основе данных tidy_twitter. В данном случае каждый твит считается отдельным документом. Выведите tidy_twitter в консоль, чтобы проверить названия столбцов.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Начните с очищенных данных Twitter.
- Подсчитайте, сколько раз каждое слово встречается в каждом твите.
- Используйте полученные счётчики слов для создания DTM.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Start with the tidied Twitter data
___ %>%
# Count each word used in each tweet
___(word, ___) %>%
# Use the word counts by tweet to create a DTM
cast_dtm(___, word, n)