НачатьНачать бесплатно

Облако сравнения

В этом упражнении вы создадите наглядную визуализацию для анализа частоты терминов. В частности, вы изучите наиболее часто встречающиеся слова в положительных и отрицательных сводных документах. Вспомните TermDocumentMatrix all_tdm, созданную ранее. Вместо 1000 отзывов об аренде матрица содержит 2 документа со всеми отзывами, разделёнными по оценке polarity().

Как правило, удобнее сначала преобразовать TDM в матрицу, а затем переименовать столбцы. Обратите внимание, что функция colnames() вызывается в левой части оператора присваивания, как показано ниже.

colnames(OBJECT) <- c("COLUMN_NAME1", "COLUMN_NAME2")

После этого вы упорядочите матрицу, чтобы увидеть наиболее позитивные и негативные слова. Изучите эти термины — они понадобятся вам при выполнении заключительных упражнений!

Наконец, вы визуализируете термины с помощью comparison.cloud().

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Matrix
___

# Column names
colnames(___) <- ___

# Top pos words
order_by_pos <- order(all_tdm_m[, ___], decreasing = ___)

# Review top 10 pos words
all_tdm_m[order_by_pos, ] %>% head(___)

# Top neg words
order_by_neg <- order(___, decreasing = ___)

# Review top 10 neg words
all_tdm_m[___, ] %>% ___
Редактировать и запускать код