Ma trận thưa
Trong bài giảng video, bạn đã học về ma trận thưa. Khi số lượng văn bản và số lượng từ độc nhất tăng lên, ma trận thưa có thể trở thành ác mộng tính toán. Việc biểu diễn từ với các tweet rất dễ tạo ra ma trận thưa vì có emoji, tiếng lóng, từ viết tắt và nhiều dạng ngôn ngữ khác được dùng.
Trong bài tập này, bạn sẽ đi qua các bước để tính mức độ thưa của bộ dữ liệu tweet tiếng Nga. Lưu ý rằng đây là một ví dụ nhỏ cho thấy phân tích văn bản có thể nhanh chóng trở thành một bài toán tính toán lớn như thế nào.
Bài tập này là một phần của khóa học
Nhập môn Xử lý Ngôn ngữ Tự nhiên với R
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)