Облако сравнения
В этом упражнении вы создадите наглядную визуализацию для анализа частоты терминов. В частности, вы изучите наиболее часто встречающиеся слова в положительных и отрицательных сводных документах. Вспомните TermDocumentMatrix all_tdm, созданную ранее. Вместо 1000 отзывов об аренде матрица содержит 2 документа со всеми отзывами, разделёнными по оценке polarity().
Как правило, удобнее сначала преобразовать TDM в матрицу, а затем переименовать столбцы. Обратите внимание, что функция colnames() вызывается в левой части оператора присваивания, как показано ниже.
colnames(OBJECT) <- c("COLUMN_NAME1", "COLUMN_NAME2")
После этого вы упорядочите матрицу, чтобы увидеть наиболее позитивные и негативные слова. Изучите эти термины — они понадобятся вам при выполнении заключительных упражнений!
Наконец, вы визуализируете термины с помощью comparison.cloud().
Это упражнение является частью курса
Анализ тональности в R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Matrix
___
# Column names
colnames(___) <- ___
# Top pos words
order_by_pos <- order(all_tdm_m[, ___], decreasing = ___)
# Review top 10 pos words
all_tdm_m[order_by_pos, ] %>% head(___)
# Top neg words
order_by_neg <- order(___, decreasing = ___)
# Review top 10 neg words
all_tdm_m[___, ] %>% ___