資料前處理
不同於前幾章我們已替你把資料整理好以進行非監督式學習,本章的目標是帶你走過更貼近實務且完整的工作流程。
回想影片內容,第一步是下載並整理資料。
本練習屬於課程
R 的無監督式學習
練習說明
- 使用
read.csv()從提供的 URL 下載包含資料的 CSV(逗號分隔值)檔,並將結果指定給wisc.df。 - 使用
as.matrix()將資料的特徵(第 3 到第 32 欄)轉換為矩陣,並存成變數wisc.data。 - 將
wisc.data的列名稱設定為目前在wisc.df的id欄中的值。這雖非絕對必要,但能幫助你在建模過程中追蹤各筆觀測。 - 最後,建立名為
diagnosis的向量:若診斷為惡性("M")則為1,否則為0。請注意,R 會將TRUE轉為 1、FALSE轉為 0。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)