Loại bỏ stop word tùy chỉnh
Các thuật ngữ phổ biến trong một tập văn bản có thể được trực quan hóa bằng biểu đồ cột hoặc word cloud.
Tuy nhiên, trước khi dùng các công cụ trực quan hóa, điều quan trọng là cần loại bỏ các stop word tùy chỉnh có trong corpus.
Trong bài tập này, bạn sẽ kiểm tra tần suất thuật ngữ và loại bỏ các stop word tùy chỉnh khỏi corpus văn bản mà bạn đã tạo cho "telemedicine".
Corpus văn bản đã được nạp sẵn dưới tên twt_corpus.
Các thư viện qdap và tm đã được nạp sẵn cho bài tập này.
Bài tập này là một phần của khóa học
Phân tích dữ liệu mạng xã hội bằng R
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Extract term frequencies for top 60 words and view output
termfreq <- ___(twt_corpus, ___)
termfreq