Bắt đầu ngayBắt đầu miễn phí

Làm sạch và đếm

Loại bỏ stop words để khám phá nội dung chỉ của các tweet về hãng hàng không được phân loại là khiếu nại trong twitter_data.

Bài tập này là một phần của khóa học

Nhập môn Phân tích Văn bản bằng R

Xem khóa học

Hướng dẫn bài tập

  • Tokenize các tweet trong twitter_data. Đặt tên cột chứa các từ đã tách là word.
  • Loại bỏ stop words mặc định khỏi twitter_data đã được tokenize.
  • Lọc để chỉ giữ các khiếu nại.
  • Tính số lần xuất hiện của từ dựa trên văn bản đã tokenize và làm sạch, rồi sắp xếp giảm dần theo số đếm.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Chỉnh sửa và Chạy Mã