开始使用免费开始使用

数据准备

与前几章不同,这一章不会替您预先处理用于无监督学习的数据。本章的目标是带您完成一个更贴近实际的完整工作流。

回顾视频内容,第一步是下载并整理数据。

本练习是课程的一部分

R 中的无监督学习

查看课程

练习说明

  • 使用 read.csv() 函数从给定的 URL 下载包含数据的 CSV(逗号分隔值)文件,并将结果赋给 wisc.df
  • 使用 as.matrix() 将数据的特征(第 3 到第 32 列)转换为矩阵,并存入名为 wisc.data 的变量。
  • wisc.data 的行名设置为当前 wisc.dfid 列的取值。虽然不是严格必需,但这有助于您在建模过程中跟踪不同观测。
  • 最后,创建一个名为 diagnosis 的向量:若诊断为恶性("M")则为 1,否则为 0。注意 R 会将 TRUE 强制转换为 1、FALSE 强制转换为 0。

交互式实操练习

通过完成这段示例代码来试试这个练习。

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
编辑并运行代码