Bắt đầu ngayBắt đầu miễn phí

Ví dụ mô hình phân loại

Trước đó bạn đã chuẩn bị một bộ tweet tiếng Nga để phân loại. Trong số 20.000 tweet, bạn đã lọc các tweet có account_typeLeft hoặc Right, và chọn 2000 tweet đầu tiên của mỗi loại. Bạn đã tách từ (tokenize) các tweet, loại bỏ stop words và thực hiện stemming. Ngoài ra, bạn đã chuyển đổi số lần xuất hiện từ thành ma trận tài liệu–thuật ngữ (document-term matrix) với trọng số TFIDF và lưu ma trận này là: left_right_matrix_small.

Bạn sẽ dùng ma trận này để dự đoán liệu một tweet được tạo ra từ bot nghiêng về cánh tả hay bot nghiêng về cánh hữu. Các nhãn nằm trong vector left_right_labels.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Hướng dẫn bài tập

  • Đặt random seed là 1111 để tái lập kết quả.
  • Tạo tập huấn luyện và tập kiểm tra. Dùng mẫu 75% cho dữ liệu huấn luyện.
  • Chạy mô hình random forest trên dữ liệu huấn luyện, dùng left_right_labels làm vector phản hồi y.
  • In kết quả của random forest.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
Chỉnh sửa và Chạy Mã