ПочатиПочніть безкоштовно

Створіть корпуси на основі полярності

У цій вправі ви виконаєте Крок 3 робочого процесу з текстового майнінгу. Хоча qdap не належить до tidy-пакетів, ви застосуєте mutate(), щоб додати новий стовпець на основі повернутого списку polarity, який представляє оцінки загальної полярності (це, до речі, підказка). У розділі 3 ми використовували власну функцію pol_subsections, що спирається лише на базові оголошення R. Однак, дотримуючись tidy-принципів, у цій вправі ви скористаєтеся filter(), а також познайомитеся з pull(). Функція pull() працює як [[ для витягання однієї змінної.

Після розділення ви об'єднаєте всі позитивні та негативні коментарі у два великі документи, які представлять усі слова у відгуках про оренду з позитивною та негативною полярністю.

Насамкінець ви створите матрицю «термін–документ» (TDM) з вагами TF–IDF (частота терміна, обернена до частоти документа). Оскільки код цієї вправи починається з tidy-структури, тут використовуються деякі функції з tm разом з оператором %>%, щоб зберегти узгоджений стиль. Якщо вам не знайомі основи пакета tm, перегляньте курс Text Mining with Bag-of-Words in R. Замість простого підрахунку, скільки разів ужито слово (частоти), значення в TDM зменшуються для надто вживаних термінів, що допомагає відсіяти неінформативні слова.

Ця вправа є частиною курсу

Аналіз тональності в R

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Редагувати та запускати код