Bắt đầu ngayBắt đầu miễn phí

Tạo Corpora dựa trên Polarity

Trong bài tập này, bạn sẽ thực hiện Bước 3 của quy trình khai phá văn bản. Mặc dù qdap không phải là một gói tidy, bạn sẽ dùng mutate() để thêm một cột mới dựa trên danh sách polarity trả về, biểu diễn điểm số all polarity (đây là gợi ý nhé). Ở chương 3, chúng ta đã dùng hàm tự viết pol_subsections chỉ sử dụng cú pháp base R. Tuy nhiên, để bám theo nguyên tắc tidy, bài tập này dùng filter() rồi giới thiệu thêm pull(). Hàm pull() hoạt động giống như [[ để trích xuất một biến duy nhất.

Sau khi tách nhóm, bạn sẽ gộp tất cả bình luận tích cực và tiêu cực thành hai tài liệu lớn, đại diện cho toàn bộ từ trong các đánh giá thuê nhà tích cực và tiêu cực.

Cuối cùng, bạn sẽ tạo Ma trận Thuật ngữ–Tài liệu (TDM) với trọng số Term Frequency–Inverse Document Frequency (TFIDF). Vì mã trong bài tập này bắt đầu với cấu trúc tidy, một số hàm mượn từ tm được dùng cùng với toán tử %>% để giữ phong cách nhất quán. Nếu bạn chưa quen với các khái niệm cơ bản của gói tm, hãy xem khóa Text Mining with Bag-of-Words in R. Thay vì chỉ đếm số lần một từ xuất hiện (tần suất), các giá trị trong TDM sẽ bị phạt cho những thuật ngữ bị lạm dụng, giúp giảm bớt các từ không mang nhiều thông tin.

Bài tập này là một phần của khóa học

Phân tích cảm xúc trong R

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Chỉnh sửa và Chạy Mã