Порівняйте Tidy Sentiment з Qdap Polarity
Тут ви побачите, що різні методи визначення сентименту дають різні результати. Часто достатньо, щоб результати збігалися за напрямом, навіть якщо деталі різняться. У попередній вправі ви створили tidy_reviews — датафрейм відгуків про оренду без стоп-слів. Раніше в цьому розділі ви обчислили й побудували базову функцію polarity() з пакета qdap. Це показало, що відгуки загалом позитивні.
Тепер виконаймо подібний аналіз способом tidytext! Нагадаємо з попереднього розділу: ви виконаєте inner_join(), потім count(), а далі pivot_wider().
Насамкінець ви створите новий стовпчик за допомогою mutate(), передавши вираз positive - negative.
Ця вправа є частиною курсу
Аналіз тональності в R
Інструкції до вправи
- Використайте функцію
get_sentiments()з параметром "bing", щоб отримати лексикон суб'єктивності Bing. Назвіть лексиконbing. - Оскільки ви вже писали цей код у розділі 2, просто вкажіть об'єкт лексикону
bing, нову назву стовпчика (polarity) та його обчислення всерединіmutate(). - Нарешті, викличте
summary()для нового об'єктаpos_neg. Хоча значення відрізняються, якщо подивитися на середнє, чи залишаються більшість відгуків про оренду так само позитивними порівняно з використаннямpolarity()? Чи бачите ви „інфляцію оцінок"?
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Get the correct lexicon
bing <- ___
# Calculate polarity for each review
pos_neg <- tidy_reviews %>%
inner_join(___) %>%
count(sentiment) %>%
pivot_wider(names_from = sentiment, values_from = n, values_fill = 0) %>%
mutate(___ = ___ - ___)
# Check outcome
___