НачатьНачать бесплатно

Повторение TM (I)

В курсе Text Mining: Bag of Words вы узнали, что корпус — это набор текстов, и изучили ряд функций для их предобработки. В качестве краткого повторения: один из способов создать и очистить корпус — воспользоваться функциями, описанными ниже. Анализ тональности является частью анализа текста, поэтому такое повторение будет полезным.

  • Преобразуйте символьный вектор в текстовый источник с помощью VectorSource().
  • Преобразуйте текстовый источник в корпус с помощью VCorpus().
  • Удалите нежелательные символы из корпуса с помощью функций очистки: removePunctuation() и stripWhitespace() из пакета tm, а также replace_abbreviation() из пакета qdap.

В этом упражнении для удобства уже создана пользовательская функция clean_corpus(), которая объединяет стандартные шаги предобработки.

clean_corpus() принимает результат VCorpus() и применяет функции очистки. Например:

processed_corpus <- clean_corpus(my_corpus)

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Инструкции к упражнению

В вашей R-сессии уже есть текстовый вектор tm_define, содержащий два небольших документа, а также функция clean_corpus().

  • Создайте объект tm_vector, применив VectorSource() к tm_define.
  • Создайте tm_corpus, применив VCorpus() к tm_vector.
  • Используйте content(), чтобы просмотреть содержимое первого документа в tm_corpus.
    • Доступ к документам корпуса осуществляется с помощью синтаксиса списков — используйте двойные квадратные скобки, например [[1]].
  • Очистите текст корпуса, применив пользовательскую функцию clean_corpus() к tm_corpus. Сохраните результат в объект tm_clean.
  • Снова просмотрите первый документ нового объекта tm_clean, чтобы увидеть, как изменился текст после применения clean_corpus().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Редактировать и запускать код