ПочатиПочніть безкоштовно

Повторення TM (I)

У курсі Text Mining: Bag of Words ви дізналися, що корпус — це набір текстів, і вивчили деякі функції для попередньої обробки тексту. Нагадаємо, один зі способів створити й очистити корпус — скористатися наведеними нижче функціями. Хоч це інший курс, аналіз тональності є частиною інтелектуального аналізу текстів, тож повторення буде доречним.

  • Перетворіть символьний вектор на текстове джерело за допомогою VectorSource().
  • Перетворіть текстове джерело на корпус за допомогою VCorpus().
  • Видаліть небажані символи з корпусу, використовуючи функції очищення, як-от removePunctuation() і stripWhitespace() з tm, а також replace_abbreviation() з qdap.

У цій вправі створено користувацьку функцію clean_corpus() на основі стандартних функцій передобробки для зручнішого застосування.

clean_corpus() приймає результат VCorpus() і застосовує функції очищення. Наприклад:

processed_corpus <- clean_corpus(my_corpus)

Ця вправа є частиною курсу

Аналіз тональності в R

Переглянути курс

Інструкції до вправи

У вашому сеансі R є текстовий вектор tm_define з двома невеликими документами та функція clean_corpus().

  • Створіть об'єкт tm_vector, застосувавши VectorSource() до tm_define.
  • Створіть tm_corpus, застосувавши VCorpus() до tm_vector.
  • Скористайтеся content(), щоб переглянути вміст першого документа в tm_corpus.
    • До документів у корпусі звертаються як до елементів списку, тож використовуйте подвійні квадратні дужки, напр., [[1]].
  • Очистьте текст корпусу, застосувавши користувацьку функцію clean_corpus() до tm_corpus. Назвіть новий об'єкт tm_clean.
  • Ще раз перегляньте перший документ нового об'єкта tm_clean, щоб побачити, як змінився текст після застосування clean_corpus().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Редагувати та запускати код