Повторение TM (II)
Теперь создадим матрицу документ–термин (DTM). В DTM:
- Каждая строка матрицы соответствует одному документу.
- Каждый столбец — уникальному токену (слову).
- Значения матрицы отражают частоту употребления слов в каждом документе.
DTM лежит в основе большинства методов анализа мешка слов. Позже в курсе вы также познакомитесь с матрицей термин–документ (TDM) — она является транспонированной версией DTM: столбцы представляют документы, а строки — уникальные токены.
DTM следует строить после очистки корпуса (с помощью clean_corpus()). Для этого вызовите DocumentTermMatrix() на объекте корпуса:
tm_dtm <- DocumentTermMatrix(tm_clean)
Если вам нужно более подробное повторение материала, обратитесь к курсу Text Mining with Bag-of-Words in R. Надеемся, эти два упражнения подготовили вас к анализу тональности текста!
Обратите внимание: это реальные данные из Twitter, поэтому они могут содержать нецензурную лексику или другой нежелательный контент (в этом и последующих упражнениях, использующих реальные данные Twitter).
Это упражнение является частью курса
Анализ тональности в R
Инструкции к упражнению
Мы создали объект VCorpus() под названием clean_text, содержащий 1000 твитов с упоминанием кофе. Твиты были очищены с помощью описанных ранее шагов предобработки. Ваша задача — построить на их основе DTM.
- Примените
DocumentTermMatrix()к корпусуclean_text, чтобы создать DTM с взвешиванием по частоте термина. Назовите результатtf_dtm. - Преобразуйте объект
DocumentTermMatrix()в обычную матрицу с помощьюas.matrix(). Назовите новый объектtf_dtm_m. - Проверьте размерности матрицы с помощью
dim(). - Используйте индексацию в квадратных скобках, чтобы просмотреть подмножество матрицы.
- Выберите строки с 16 по 20 и столбцы с 2975 по 2985.
- Обратите внимание на значение частоты слова "working."
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]