ÎncepețiÎncepe gratuit

Pregătirea datelor

Spre deosebire de capitolele anterioare, unde datele erau pregătite pentru tine în vederea învățării nesupervizate, scopul acestui capitol este să te ghideze printr-un flux de lucru mai realist și mai complet.

Amintește-ți din video că primul pas este să descarci și să pregătești datele.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește funcția read.csv() pentru a descărca fișierul CSV (valori separate prin virgulă) care conține datele de la URL-ul furnizat. Atribuie rezultatul variabilei wisc.df.
  • Folosește as.matrix() pentru a converti caracteristicile din date (coloanele 3 până la 32) într-o matrice. Stochează rezultatul într-o variabilă numită wisc.data.
  • Atribuie numelor de rând ale wisc.data valorile din coloana id a lui wisc.df. Deși nu este strict necesar, acest lucru te va ajuta să urmărești diferitele observații pe parcursul procesului de modelare.
  • În final, definește un vector numit diagnosis cu valoarea 1 dacă diagnosticul este malign ("M") și 0 în caz contrar. Reține că R convertește automat TRUE la 1 și FALSE la 0.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
Editează și rulează codul