НачатьНачать бесплатно

Повторение TM (II)

Теперь создадим матрицу документ–термин (DTM). В DTM:

  • Каждая строка матрицы соответствует одному документу.
  • Каждый столбец — уникальному токену (слову).
  • Значения матрицы отражают частоту употребления слов в каждом документе.

DTM лежит в основе большинства методов анализа мешка слов. Позже в курсе вы также познакомитесь с матрицей термин–документ (TDM) — она является транспонированной версией DTM: столбцы представляют документы, а строки — уникальные токены.

DTM следует строить после очистки корпуса (с помощью clean_corpus()). Для этого вызовите DocumentTermMatrix() на объекте корпуса:

tm_dtm <- DocumentTermMatrix(tm_clean)

Если вам нужно более подробное повторение материала, обратитесь к курсу Text Mining with Bag-of-Words in R. Надеемся, эти два упражнения подготовили вас к анализу тональности текста!

Обратите внимание: это реальные данные из Twitter, поэтому они могут содержать нецензурную лексику или другой нежелательный контент (в этом и последующих упражнениях, использующих реальные данные Twitter).

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Инструкции к упражнению

Мы создали объект VCorpus() под названием clean_text, содержащий 1000 твитов с упоминанием кофе. Твиты были очищены с помощью описанных ранее шагов предобработки. Ваша задача — построить на их основе DTM.

  • Примените DocumentTermMatrix() к корпусу clean_text, чтобы создать DTM с взвешиванием по частоте термина. Назовите результат tf_dtm.
  • Преобразуйте объект DocumentTermMatrix() в обычную матрицу с помощью as.matrix(). Назовите новый объект tf_dtm_m.
  • Проверьте размерности матрицы с помощью dim().
  • Используйте индексацию в квадратных скобках, чтобы просмотреть подмножество матрицы.
  • Выберите строки с 16 по 20 и столбцы с 2975 по 2985.
  • Обратите внимание на значение частоты слова "working."

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Редактировать и запускать код