Làm sạch và đếm
Loại bỏ stop words để khám phá nội dung chỉ của các tweet về hãng hàng không được phân loại là khiếu nại trong twitter_data.
Bài tập này là một phần của khóa học
Nhập môn Phân tích Văn bản bằng R
Hướng dẫn bài tập
- Tokenize các tweet trong
twitter_data. Đặt tên cột chứa các từ đã tách làword. - Loại bỏ stop words mặc định khỏi
twitter_datađã được tokenize. - Lọc để chỉ giữ các khiếu nại.
- Tính số lần xuất hiện của từ dựa trên văn bản đã tokenize và làm sạch, rồi sắp xếp giảm dần theo số đếm.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)