1. Learn
  2. /
  3. Курси
  4. /
  5. Аналіз тональності в R

Connected

Вправа

Порівняйте й зіставте стовпчикову діаграму з накопиченням

Ще один спосіб проаналізувати текст — з'ясувати, якою мірою документи складаються з позитивних або негативних слів. Наприклад, відгук про ресторан може містити щось позитивне на кшталт «їжа була смачна», але далі додати: «у ресторані було брудно, персонал — грубий, а паркування — жахливе». У результаті ви можете захотіти зрозуміти, яка частка документа присвячена позитивній проти негативної лексики. У цьому прикладі відсоток негативу буде вищим за позитив.

Один зі способів — порахувати (count()) позитивні та негативні слова, а потім поділити на кількість слів суб'єктивності, які ідентифіковано. У прикладі з відгуком «смачна» (good) зараховується як 1 позитив, а «брудно» (dirty), «грубий» (rude) і «жахливе» (awful) — як 3 негативні терміни. Простий підрахунок підкаже, що відгук є на 25% позитивним і на 75% негативним, адже всього було 4 терміни суб'єктивності.

Почніть із виконання inner_join() на уніфікованому охайному датафреймі, що містить 4 книжки: Agamemnon, Oz, Huck Finn і Moby Dick. Як і в попередній вправі, ви використаєте filter() і grepl().

Щоб виконати count(), потрібно згрупувати дані за книжкою, а потім за типом сентименту. Наприклад, усі позитивні слова для Agamemnon слід згрупувати та підсумувати, щоб позитивні слова з різних книжок не змішувалися. На щастя, у count() можна передати кілька змінних безпосередньо.

Інструкції 1/3

undefined XP
    1
    2
    3
  • Зробіть inner join all_books із лексиконом nrc.
  • Відфільтруйте рядки, де sentiment містить "positive" або "negative". Тобто використайте grepl() для стовпця sentiment, перевіряючи БЕЗ заперечення, щоб зберегти "positive|negative".
  • Порахуйте за book і sentiment.