Повторение TM (I)
В курсе Text Mining: Bag of Words вы узнали, что корпус — это набор текстов, и изучили ряд функций для их предобработки. В качестве краткого повторения: один из способов создать и очистить корпус — воспользоваться функциями, описанными ниже. Анализ тональности является частью анализа текста, поэтому такое повторение будет полезным.
- Преобразуйте символьный вектор в текстовый источник с помощью
VectorSource(). - Преобразуйте текстовый источник в корпус с помощью
VCorpus(). - Удалите нежелательные символы из корпуса с помощью функций очистки:
removePunctuation()иstripWhitespace()из пакетаtm, а такжеreplace_abbreviation()из пакетаqdap.
В этом упражнении для удобства уже создана пользовательская функция clean_corpus(), которая объединяет стандартные шаги предобработки.
clean_corpus() принимает результат VCorpus() и применяет функции очистки. Например:
processed_corpus <- clean_corpus(my_corpus)
Это упражнение является частью курса
Анализ тональности в R
Инструкции к упражнению
В вашей R-сессии уже есть текстовый вектор tm_define, содержащий два небольших документа, а также функция clean_corpus().
- Создайте объект
tm_vector, применивVectorSource()кtm_define. - Создайте
tm_corpus, применивVCorpus()кtm_vector. - Используйте
content(), чтобы просмотреть содержимое первого документа вtm_corpus.- Доступ к документам корпуса осуществляется с помощью синтаксиса списков — используйте двойные квадратные скобки, например
[[1]].
- Доступ к документам корпуса осуществляется с помощью синтаксиса списков — используйте двойные квадратные скобки, например
- Очистите текст корпуса, применив пользовательскую функцию
clean_corpus()кtm_corpus. Сохраните результат в объектtm_clean. - Снова просмотрите первый документ нового объекта
tm_clean, чтобы увидеть, как изменился текст после примененияclean_corpus().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___