開始使用免費開始

資料前處理

不同於前幾章我們已替你把資料整理好以進行非監督式學習,本章的目標是帶你走過更貼近實務且完整的工作流程。

回想影片內容,第一步是下載並整理資料。

本練習屬於課程

R 的無監督式學習

檢視課程

練習說明

  • 使用 read.csv() 從提供的 URL 下載包含資料的 CSV(逗號分隔值)檔,並將結果指定給 wisc.df
  • 使用 as.matrix() 將資料的特徵(第 3 到第 32 欄)轉換為矩陣,並存成變數 wisc.data
  • wisc.data 的列名稱設定為目前在 wisc.dfid 欄中的值。這雖非絕對必要,但能幫助你在建模過程中追蹤各筆觀測。
  • 最後,建立名為 diagnosis 的向量:若診斷為惡性("M")則為 1,否則為 0。請注意,R 會將 TRUE 轉為 1、FALSE 轉為 0。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
編輯並執行程式碼