Створіть корпуси на основі полярності
У цій вправі ви виконаєте Крок 3 робочого процесу з текстового майнінгу. Хоча qdap не належить до tidy-пакетів, ви застосуєте mutate(), щоб додати новий стовпець на основі повернутого списку polarity, який представляє оцінки загальної полярності (це, до речі, підказка). У розділі 3 ми використовували власну функцію pol_subsections, що спирається лише на базові оголошення R. Однак, дотримуючись tidy-принципів, у цій вправі ви скористаєтеся filter(), а також познайомитеся з pull(). Функція pull() працює як [[ для витягання однієї змінної.
Після розділення ви об'єднаєте всі позитивні та негативні коментарі у два великі документи, які представлять усі слова у відгуках про оренду з позитивною та негативною полярністю.
Насамкінець ви створите матрицю «термін–документ» (TDM) з вагами TF–IDF (частота терміна, обернена до частоти документа). Оскільки код цієї вправи починається з tidy-структури, тут використовуються деякі функції з tm разом з оператором %>%, щоб зберегти узгоджений стиль. Якщо вам не знайомі основи пакета tm, перегляньте курс Text Mining with Bag-of-Words in R. Замість простого підрахунку, скільки разів ужито слово (частоти), значення в TDM зменшуються для надто вживаних термінів, що допомагає відсіяти неінформативні слова.
Ця вправа є частиною курсу
Аналіз тональності в R
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")