数据准备
与前几章不同,这一章不会替您预先处理用于无监督学习的数据。本章的目标是带您完成一个更贴近实际的完整工作流。
回顾视频内容,第一步是下载并整理数据。
本练习是课程的一部分
R 中的无监督学习
练习说明
- 使用
read.csv()函数从给定的 URL 下载包含数据的 CSV(逗号分隔值)文件,并将结果赋给wisc.df。 - 使用
as.matrix()将数据的特征(第 3 到第 32 列)转换为矩阵,并存入名为wisc.data的变量。 - 将
wisc.data的行名设置为当前wisc.df中id列的取值。虽然不是严格必需,但这有助于您在建模过程中跟踪不同观测。 - 最后,创建一个名为
diagnosis的向量:若诊断为恶性("M")则为1,否则为0。注意 R 会将TRUE强制转换为 1、FALSE强制转换为 0。
交互式实操练习
通过完成这段示例代码来试试这个练习。
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)