НачатьНачать бесплатно

Сравнение тонального анализа Tidy с полярностью Qdap

В этом упражнении вы убедитесь, что разные методы анализа тональности дают разные результаты. Как правило, достаточно, чтобы результаты совпадали по направлению, даже если конкретные значения различаются. В предыдущем упражнении вы создали tidy_reviews — фрейм данных с отзывами об аренде без стоп-слов. Ранее в этой главе вы вычислили и визуализировали базовую функцию polarity() из пакета qdap, которая показала, что отзывы в целом позитивны.

Теперь выполним аналогичный анализ с помощью tidytext! Вспомните из предыдущей главы: сначала применяется inner_join(), затем count() и pivot_wider().

Наконец, с помощью mutate() создайте новый столбец, передав выражение positive - negative.

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Инструкции к упражнению

  • С помощью функции get_sentiments() с аргументом "bing" получите субъективный лексикон bing. Сохраните его в переменную bing.
  • Поскольку этот код уже был написан в главе 2, просто укажите объект лексикона bing, название нового столбца (polarity) и его вычисление внутри mutate().
  • Наконец, вызовите summary() для нового объекта pos_neg. Несмотря на различие в значениях, посмотрите на среднее: большинство отзывов об аренде так же позитивны, как при использовании polarity()? Замечаете ли вы эффект «завышения оценок»?

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Get the correct lexicon
bing <- ___

# Calculate polarity for each review
pos_neg <- tidy_reviews %>% 
  inner_join(___) %>%
  count(sentiment) %>%
  pivot_wider(names_from = sentiment, values_from = n, values_fill = 0) %>% 
  mutate(___ = ___ - ___)

# Check outcome
___
Редактировать и запускать код