Przygotowanie danych
W poprzednich rozdziałach dane do uczenia bez nadzoru były już dla ciebie przygotowane. Celem tego rozdziału jest przeprowadzenie cię przez bardziej realistyczny i kompletny proces pracy.
Pamiętaj z materiału wideo, że pierwszym krokiem jest pobranie i przygotowanie danych.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w R
Instrukcje do ćwiczenia
- Użyj funkcji
read.csv(), aby pobrać plik CSV (wartości oddzielone przecinkami) z danymi spod podanego adresu URL. Wynik przypisz do zmiennejwisc.df. - Użyj
as.matrix(), aby przekonwertować cechy z danych (kolumny od 3 do 32) na macierz. Zapisz wynik w zmiennej o nazwiewisc.data. - Przypisz nazwom wierszy
wisc.datawartości aktualnie zawarte w kolumnieidramkiwisc.df. Nie jest to bezwzględnie wymagane, ale ułatwi śledzenie poszczególnych obserwacji podczas modelowania. - Na koniec ustaw wektor
diagnosistak, aby przyjmował wartość1, gdy diagnoza jest złośliwa ("M"), i0w pozostałych przypadkach. Pamiętaj, że R zamieniaTRUEna 1, aFALSEna 0.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)