Daten vorbereiten
Anders als in den vorherigen Kapiteln, in denen wir die Daten für das Unsupervised Learning für dich vorbereitet haben, soll dich dieses Kapitel durch einen realistischeren und vollständigeren Workflow führen.
Erinnere dich aus dem Video: Der erste Schritt ist, die Daten herunterzuladen und aufzubereiten.
Diese Übung ist Teil des Kurses
<Kurs>Unüberwachtes Lernen in R</Kurs>Übungsanweisungen
- Verwende die Funktion
read.csv(), um die CSV-Datei (Comma-Separated Values) mit den Daten von der angegebenen URL herunterzuladen. Weisen den Rückgabewertwisc.dfzu. - Verwende
as.matrix(), um die Merkmale (in den Spalten 3 bis 32) in eine Matrix umzuwandeln. Speichere diese in einer Variablen namenswisc.data. - Weise den Zeilennamen von
wisc.datadie Werte zu, die derzeit in der Spalteidvonwisc.dfstehen. Das ist nicht zwingend erforderlich, hilft dir aber, während des Modellierungsprozesses den Überblick über die einzelnen Beobachtungen zu behalten. - Setze schließlich einen Vektor namens
diagnosisauf1, wenn eine Diagnose bösartig ("M") ist, und andernfalls auf0. Beachte, dass RTRUEzu 1 undFALSEzu 0 zwingt.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"
# Download the data: wisc.df
# Convert the features of the data: wisc.data
# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___
# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)