Bắt đầu ngayBắt đầu miễn phí

Chuẩn bị dữ liệu

Khác với các chương trước, nơi chúng tôi đã chuẩn bị sẵn dữ liệu cho bạn để làm unsupervised learning, mục tiêu của chương này là hướng dẫn bạn qua một quy trình làm việc thực tế và đầy đủ hơn.

Hãy nhớ lại từ video: bước đầu tiên là tải xuống và chuẩn bị dữ liệu.

Bài tập này là một phần của khóa học

Học không giám sát với R

Xem khóa học

Hướng dẫn bài tập

  • Dùng hàm read.csv() để tải tệp CSV (giá trị phân tách bằng dấu phẩy) chứa dữ liệu từ URL đã cung cấp. Gán kết quả cho wisc.df.
  • Dùng as.matrix() để chuyển các đặc trưng của dữ liệu (ở các cột từ 3 đến 32) thành ma trận. Lưu vào biến wisc.data.
  • Gán tên hàng (row names) của wisc.data bằng các giá trị hiện có trong cột id của wisc.df. Việc này không bắt buộc, nhưng sẽ giúp bạn theo dõi các quan sát khác nhau trong suốt quá trình mô hình hóa.
  • Cuối cùng, tạo một vector tên diagnosis nhận giá trị 1 nếu chẩn đoán là ác tính ("M") và 0 nếu không. Lưu ý R ép TRUE thành 1 và FALSE thành 0.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
Chỉnh sửa và Chạy Mã