1. Learn
  2. /
  3. Курси
  4. /
  5. Аналіз тональності в R

Connected

Вправа

Повторення TM (I)

У курсі Text Mining: Bag of Words ви дізналися, що корпус — це набір текстів, і вивчили деякі функції для попередньої обробки тексту. Нагадаємо, один зі способів створити й очистити корпус — скористатися наведеними нижче функціями. Хоч це інший курс, аналіз тональності є частиною інтелектуального аналізу текстів, тож повторення буде доречним.

  • Перетворіть символьний вектор на текстове джерело за допомогою VectorSource().
  • Перетворіть текстове джерело на корпус за допомогою VCorpus().
  • Видаліть небажані символи з корпусу, використовуючи функції очищення, як-от removePunctuation() і stripWhitespace() з tm, а також replace_abbreviation() з qdap.

У цій вправі створено користувацьку функцію clean_corpus() на основі стандартних функцій передобробки для зручнішого застосування.

clean_corpus() приймає результат VCorpus() і застосовує функції очищення. Наприклад:

processed_corpus <- clean_corpus(my_corpus)

Інструкції

100 XP

У вашому сеансі R є текстовий вектор tm_define з двома невеликими документами та функція clean_corpus().

  • Створіть об'єкт tm_vector, застосувавши VectorSource() до tm_define.
  • Створіть tm_corpus, застосувавши VCorpus() до tm_vector.
  • Скористайтеся content(), щоб переглянути вміст першого документа в tm_corpus.
    • До документів у корпусі звертаються як до елементів списку, тож використовуйте подвійні квадратні дужки, напр., [[1]].
  • Очистьте текст корпусу, застосувавши користувацьку функцію clean_corpus() до tm_corpus. Назвіть новий об'єкт tm_clean.
  • Ще раз перегляньте перший документ нового об'єкта tm_clean, щоб побачити, як змінився текст після застосування clean_corpus().