LoslegenKostenlos starten

Daten vorbereiten

Anders als in den vorherigen Kapiteln, in denen wir die Daten für das Unsupervised Learning für dich vorbereitet haben, soll dich dieses Kapitel durch einen realistischeren und vollständigeren Workflow führen.

Erinnere dich aus dem Video: Der erste Schritt ist, die Daten herunterzuladen und aufzubereiten.

Diese Übung ist Teil des Kurses

<Kurs>Unüberwachtes Lernen in R</Kurs>
Kurs ansehen

Übungsanweisungen

  • Verwende die Funktion read.csv(), um die CSV-Datei (Comma-Separated Values) mit den Daten von der angegebenen URL herunterzuladen. Weisen den Rückgabewert wisc.df zu.
  • Verwende as.matrix(), um die Merkmale (in den Spalten 3 bis 32) in eine Matrix umzuwandeln. Speichere diese in einer Variablen namens wisc.data.
  • Weise den Zeilennamen von wisc.data die Werte zu, die derzeit in der Spalte id von wisc.df stehen. Das ist nicht zwingend erforderlich, hilft dir aber, während des Modellierungsprozesses den Überblick über die einzelnen Beobachtungen zu behalten.
  • Setze schließlich einen Vektor namens diagnosis auf 1, wenn eine Diagnose bösartig ("M") ist, und andernfalls auf 0. Beachte, dass R TRUE zu 1 und FALSE zu 0 zwingt.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

url <- "https://assets.datacamp.com/production/course_1903/datasets/WisconsinCancer.csv"

# Download the data: wisc.df


# Convert the features of the data: wisc.data


# Set the row names of wisc.data
row.names(wisc.data) <- wisc.df$___

# Create diagnosis vector
diagnosis <- as.numeric(wisc.df$diagnosis == ___)
Code bearbeiten und ausführen