Створення DTM
Створіть матрицю «документ–терм» (DTM) з наших даних tidy_twitter. У цьому випадку кожен твіт вважається документом. Виведіть tidy_twitter у консоль, щоб перевірити назви стовпців.
Ця вправа є частиною курсу
Вступ до аналізу тексту в R
Інструкції до вправи
- Почніть з упорядкованих даних Twitter.
- Порахуйте, скільки разів кожне слово зустрічається в кожному твіті.
- Використайте підрахунки слів за твітом, щоб створити DTM.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Start with the tidied Twitter data
___ %>%
# Count each word used in each tweet
___(word, ___) %>%
# Use the word counts by tweet to create a DTM
cast_dtm(___, word, n)