Chuẩn bị dữ liệu
Khác với các chương trước, nơi chúng tôi đã chuẩn bị sẵn dữ liệu cho bạn để làm unsupervised learning, mục tiêu của chương này là hướng dẫn bạn qua một quy trình làm việc thực tế và đầy đủ hơn.
Hãy nhớ lại từ video: bước đầu tiên là tải xuống và chuẩn bị dữ liệu.
Bài tập này là một phần của khóa học
Học không giám sát với R
Hướng dẫn bài tập
- Dùng hàm
read.csv()để tải tệp CSV (giá trị phân tách bằng dấu phẩy) chứa dữ liệu từ URL đã cung cấp. Gán kết quả chowisc.df. - Dùng
as.matrix()để chuyển các đặc trưng của dữ liệu (ở các cột từ 3 đến 32) thành ma trận. Lưu vào biếnwisc.data. - Gán tên hàng (row names) của
wisc.databằng các giá trị hiện có trong cộtidcủawisc.df. Việc này không bắt buộc, nhưng sẽ giúp bạn theo dõi các quan sát khác nhau trong suốt quá trình mô hình hóa. - Cuối cùng, tạo một vector tên
diagnosisnhận giá trị1nếu chẩn đoán là ác tính ("M") và0nếu không. Lưu ý R épTRUEthành 1 vàFALSEthành 0.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)