1. Learn
  2. /
  3. Курси
  4. /
  5. Аналіз тональності в R

Connected

Вправа

Дивовижний чарівник NRC

І насамкінець ви попрацюєте з лексиконом NRC, який позначає слова за кількома емоційними станами. Пам'ятаєте колесо емоцій Плучіка? Лексикон NRC тегує слова згідно з 8 емоціями Плучіка плюс позитивна/негативна полярність.

У цій вправі є новий оператор, %in%, який звіряє елементи одного вектора з іншим. У коді нижче %in% поверне FALSE, FALSE, TRUE. Так відбувається тому, що в some_vec значення 1 і 2 не знайдено у some_other_vector, а 3 знайдено, тож повертається TRUE. Оператор %in% корисний для пошуку збігів.

some_vec <- c(1, 2, 3)
some_other_vector <- c(3, "a", "b")
some_vec %in% some_other_vector

Ще один новий оператор — це !. Для логічних умов додавання ! інвертує результат. У наведеному вище прикладі FALSE, FALSE, TRUE стане TRUE, TRUE, FALSE. Використовуючи його разом із %in%, ви інвертуєте відповідь — це зручно, коли потрібно вилучити елементи, що збігаються.

!some_vec %in% some_other_vector

Ми підготували oz — «tidy»-версію тексту The Wizard of Oz, а також nrc, що містить лексикон "NRC" з перейменованими стовпцями.

Інструкції 1/2

undefined XP
    1
    2
  • Зробіть inner join oz з лексиконом nrc.
    • Викличте inner_join(), щоб об'єднати tibble-об'єкти.
    • Об'єднайте за by — стовпцем term у тексті та стовпцем word у лексиконі.
  • Відфільтруйте лише емоції Плучіка та приберіть позитивні й негативні слова з лексикону.
    • Використайте filter(), щоб залишити рядки, де sentiment — це не "positive" і не "negative".
  • Згрупуйте за sentiment.
    • Викличте group_by(), передайте sentiment без лапок.
  • Отримайте загальну кількість для кожної емоції.
    • Викличте summarize(), встановивши total_count рівним sum() від count.
    • Присвойте результат до oz_plutchik.