НачатьНачать бесплатно

Создание корпусов на основе полярности

В этом упражнении вы выполните шаг 3 рабочего процесса анализа текста. Хотя qdap не является tidy-пакетом, вы воспользуетесь mutate(), чтобы добавить новый столбец на основе возвращаемого списка polarity, представляющего все оценки полярности (это подсказка, кстати). В главе 3 мы использовали пользовательскую функцию pol_subsections, основанную только на базовых средствах R. Однако, следуя принципам tidy, в этом упражнении применяется filter(), а также вводится pull(). Функция pull() работает аналогично [[ и извлекает одну переменную.

После разделения вы объедините все положительные и отрицательные комментарии в два больших документа, представляющих все слова среди положительных и отрицательных отзывов об аренде.

Наконец, вы создадите матрицу «термин–документ» (TDM) с весами TF-IDF (Term Frequency Inverse Document Frequency). Поскольку код этого упражнения начинается с tidy-структуры, некоторые функции из пакета tm используются вместе с оператором %>% для сохранения единого стиля. Если базовые возможности пакета tm вам незнакомы, обратитесь к курсу Text Mining with Bag-of-Words in R. В отличие от простого подсчёта частоты слов, значения в TDM штрафуются за слишком часто встречающиеся термины — это помогает снизить влияние неинформативных слов.

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Редактировать и запускать код