Полярность на реальном тексте
К этому моменту вы изучили основные компоненты, необходимые для определения позитивной или негативной тональности текста. Запомните несколько ключевых моментов — они помогут вам уверенно интерпретировать результаты.
- Субъективный лексикон — это заранее составленный список слов, связанных с эмоциями или положительными/отрицательными чувствами.
- Перечислять все слова субъективного лексикона не нужно: закон Ципфа описывает закономерности человеческого общения.
Быстрый способ начать работу — воспользоваться функцией polarity(), в которую уже встроен субъективный лексикон.
Функция сканирует текст и находит слова из лексикона. Затем вокруг каждого найденного субъективного слова формируется кластер. Внутри кластера валентные сдвигатели корректируют оценку. Валентные сдвигатели — это слова, которые усиливают или отрицают эмоциональную окраску субъективного слова. Например, «широко известный» несёт положительную коннотацию, тогда как «не широко известный» — отрицательную. Здесь «не» является отрицателем и меняет эмоциональный смысл выражения «широко известный» на противоположный. Напротив, «очень широко известный» использует усилитель, который увеличивает положительную окраску.
Функция polarity() вычисляет оценку на основе субъективных терминов, валентных сдвигателей и общего количества слов в тексте. Это упражнение демонстрирует простой расчёт полярности. В следующем видео мы рассмотрим устройство функции polarity() подробнее.
Это упражнение является частью курса
Анализ тональности в R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Example statement
positive <- "DataCamp courses are good for learning"
# Calculate polarity of statement
(pos_score <-___(___))