Pregătirea datelor
Spre deosebire de capitolele anterioare, unde datele erau pregătite pentru tine în vederea învățării nesupervizate, scopul acestui capitol este să te ghideze printr-un flux de lucru mai realist și mai complet.
Amintește-ți din video că primul pas este să descarci și să pregătești datele.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
- Folosește funcția
read.csv()pentru a descărca fișierul CSV (valori separate prin virgulă) care conține datele de la URL-ul furnizat. Atribuie rezultatul variabileiwisc.df. - Folosește
as.matrix()pentru a converti caracteristicile din date (coloanele 3 până la 32) într-o matrice. Stochează rezultatul într-o variabilă numităwisc.data. - Atribuie numelor de rând ale
wisc.datavalorile din coloanaida luiwisc.df. Deși nu este strict necesar, acest lucru te va ajuta să urmărești diferitele observații pe parcursul procesului de modelare. - În final, definește un vector numit
diagnosiscu valoarea1dacă diagnosticul este malign ("M") și0în caz contrar. Reține că R convertește automatTRUEla 1 șiFALSEla 0.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)