ПочатиПочніть безкоштовно

Очищення та підрахунок

Вилучіть стоп-слова, щоб дослідити зміст лише тих твітів авіаліній у twitter_data, які класифіковані як скарги.

Ця вправа є частиною курсу

Вступ до аналізу тексту в R

Переглянути курс

Інструкції до вправи

  • Токенізуйте твіти в twitter_data. Назвіть стовпець із токенізованими словами word.
  • Вилучіть типові стоп-слова з токенізованих twitter_data.
  • Відфільтруйте, щоб залишити лише скарги.
  • Обчисліть частоти слів, використовуючи токенізований очищений текст, і відсортуйте за спаданням за кількістю.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Редагувати та запускати код