Повторення TM (I)
У курсі Text Mining: Bag of Words ви дізналися, що корпус — це набір текстів, і вивчили деякі функції для попередньої обробки тексту. Нагадаємо, один зі способів створити й очистити корпус — скористатися наведеними нижче функціями. Хоч це інший курс, аналіз тональності є частиною інтелектуального аналізу текстів, тож повторення буде доречним.
- Перетворіть символьний вектор на текстове джерело за допомогою
VectorSource(). - Перетворіть текстове джерело на корпус за допомогою
VCorpus(). - Видаліть небажані символи з корпусу, використовуючи функції очищення, як-от
removePunctuation()іstripWhitespace()зtm, а такожreplace_abbreviation()зqdap.
У цій вправі створено користувацьку функцію clean_corpus() на основі стандартних функцій передобробки для зручнішого застосування.
clean_corpus() приймає результат VCorpus() і застосовує функції очищення. Наприклад:
processed_corpus <- clean_corpus(my_corpus)
Ця вправа є частиною курсу
Аналіз тональності в R
Інструкції до вправи
У вашому сеансі R є текстовий вектор tm_define з двома невеликими документами та функція clean_corpus().
- Створіть об'єкт
tm_vector, застосувавшиVectorSource()доtm_define. - Створіть
tm_corpus, застосувавшиVCorpus()доtm_vector. - Скористайтеся
content(), щоб переглянути вміст першого документа вtm_corpus.- До документів у корпусі звертаються як до елементів списку, тож використовуйте подвійні квадратні дужки, напр.,
[[1]].
- До документів у корпусі звертаються як до елементів списку, тож використовуйте подвійні квадратні дужки, напр.,
- Очистьте текст корпусу, застосувавши користувацьку функцію
clean_corpus()доtm_corpus. Назвіть новий об'єктtm_clean. - Ще раз перегляньте перший документ нового об'єкта
tm_clean, щоб побачити, як змінився текст після застосуванняclean_corpus().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___