Začněte nyníZačněte zdarma

Příprava dat

Na rozdíl od předchozích kapitol, kde jsme data pro unsupervised learning připravili za tebe, je cílem této kapitoly provést tě realističtějším a kompletnějším pracovním postupem.

Jak zaznělo ve videu, prvním krokem je stažení a příprava dat.

Toto cvičení je součástí kurzu

Unsupervised Learning in R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí funkce read.csv() stáhni CSV soubor s daty z poskytnuté URL adresy. Výsledek ulož do proměnné wisc.df.
  • Pomocí as.matrix() převeď příznaky z dat (sloupce 3 až 32) na matici. Ulož ji do proměnné wisc.data.
  • Jako názvy řádků wisc.data nastav hodnoty ze sloupce id v wisc.df. Není to nezbytně nutné, ale pomůže ti to sledovat jednotlivá pozorování v průběhu celého modelovacího procesu.
  • Nakonec vytvoř vektor diagnosis, který bude mít hodnotu 1, pokud je diagnóza maligní ("M"), a 0 jinak. Nezapomeň, že R převádí TRUE na 1 a FALSE na 0.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
Upravit a spustit kód