LoslegenKostenlos starten

Ein Modell zur Vorhersage von Fahrradverleih-Zahlen fitten

In dieser Übung baust du ein Modell, das die Anzahl ausgeliehener Fahrräder pro Stunde als Funktion des Wetters, des TagesTyps (Feiertag, Arbeitstag oder Wochenende) und der Tageszeit vorhersagt. Du trainierst das Modell auf Daten aus dem Monat Juli.

Der Data Frame hat die Spalten:

  • cnt: die Anzahl der in dieser Stunde ausgeliehenen Fahrräder (das Ergebnis)
  • hr: die Stunde des Tages (0–23, als Faktor)
  • holiday: TRUE/FALSE
  • workingday: TRUE, wenn weder Feiertag noch Wochenende, sonst FALSE
  • weathersit: kategorial, "Clear to partly cloudy"/"Light Precipitation"/"Misty"
  • temp: normalisierte Temperatur in Grad Celsius
  • atemp: normalisierte „gefühlte“ Temperatur in Grad Celsius
  • hum: normalisierte Luftfeuchtigkeit
  • windspeed: normalisierte Windgeschwindigkeit
  • instant: der Zeitindex – Anzahl der Stunden seit Beginn des Datensatzes (keine Variable)
  • mnth und yr: Monats- und Jahresindizes (keine Variablen)

Denk daran: Du musst family = poisson oder family = quasipoisson angeben, wenn du mit glm() (docs) ein Zählmodell fitten willst.

Da es viele Eingabevariablen gibt, werden wir der Bequemlichkeit halber das Ergebnis und die Inputs in Variablen angeben und paste() (docs) verwenden, um einen String zusammenzusetzen, der die Modellformel darstellt.

Der Data Frame bikesJuly steht bereit. Die Namen der Ergebnisvariablen und der Eingangsvariablen wurden ebenfalls als Variablen outcome bzw. vars geladen.

Diese Übung ist Teil des Kurses

<Kurs>Überwachtes Lernen in R: Regression</Kurs>
Kurs ansehen

Übungsanweisungen

  • Ergänze die Lücken, um die Formel fmla zu erstellen, die cnt als Funktion der Inputs ausdrückt. Gib sie aus.
  • Berechne den Mittelwert (mean()) und die Varianz (var()) von bikesJuly$cnt.
    • Solltest du eine Poisson- oder eine Quasipoisson-Regression verwenden?
  • Verwende glm(), um ein Modell auf den bikesJuly-Daten zu fitten: bike_model.
  • Nutze glance(), um dir die Gütemaße des Modells anzusehen. Weise die Ausgabe von glance() der Variablen perf zu.
  • Berechne das Pseudo-R-Quadrat des Modells.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# bikesJuly is available
str(bikesJuly)

# The outcome column
outcome 

# The inputs to use
vars 

# Create the formula string for bikes rented as a function of the inputs
(fmla <- paste(___, "~", paste(___, collapse = " + ")))

# Calculate the mean and variance of the outcome
(mean_bikes <- ___)
(var_bikes <- ___)

# Fit the model
bike_model <- ___

# Call glance
(perf <- ___)

# Calculate pseudo-R-squared
(pseudoR2 <- ___)
Code bearbeiten und ausführen