ÎncepețiÎncepe gratuit

Antrenează un model pentru a prezice numărul de biciclete închiriate

În acest exercițiu, vei construi un model care să prezică numărul de biciclete închiriate într-o oră, în funcție de condițiile meteorologice, tipul zilei (zi liberă, zi lucrătoare sau weekend) și ora din zi. Vei antrena modelul pe date din luna iulie.

Dataframe-ul conține următoarele coloane:

  • cnt: numărul de biciclete închiriate în acea oră (variabila de răspuns)
  • hr: ora din zi (0-23, ca factor)
  • holiday: TRUE/FALSE
  • workingday: TRUE dacă nu este nici zi liberă, nici weekend, altfel FALSE
  • weathersit: categorial, "Clear to partly cloudy"/"Light Precipitation"/"Misty"
  • temp: temperatura normalizată în grade Celsius
  • atemp: temperatura „resimțită" normalizată în grade Celsius
  • hum: umiditatea normalizată
  • windspeed: viteza vântului normalizată
  • instant: indexul de timp -- numărul de ore de la începutul setului de date (nu este o variabilă)
  • mnth și yr: indici pentru lună și an (nu sunt variabile)

Rețineți că trebuie să specifici family = poisson sau family = quasipoisson atunci când folosești glm() (docs) pentru a antrena un model de numărare.

Deoarece există multe variabile de intrare, pentru comoditate vom specifica variabila de răspuns și variabilele de intrare în variabile separate și vom folosi paste() (docs) pentru a construi un șir de caractere care reprezintă formula modelului.

Dataframe-ul bikesJuly este disponibil pentru utilizare. Numele variabilei de răspuns și ale variabilelor de intrare au fost, de asemenea, încărcate ca variabilele outcome și, respectiv, vars.

Acest exercițiu face parte din cursul

Învățare supervizată în R: Regresia

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează spațiile libere pentru a crea formula fmla care exprimă cnt ca funcție de variabilele de intrare. Afișeaz-o.
  • Calculează media (mean()) și varianța (var()) ale bikesJuly$cnt.
    • Ar trebui să folosești regresia poisson sau quasipoisson?
  • Folosește glm() pentru a antrena un model pe datele din bikesJuly: bike_model.
  • Folosește glance() pentru a examina statisticile de ajustare ale modelului. Atribuie rezultatul funcției glance() variabilei perf.
  • Calculează pseudo-R-pătrat al modelului.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# bikesJuly is available
str(bikesJuly)

# The outcome column
outcome 

# The inputs to use
vars 

# Create the formula string for bikes rented as a function of the inputs
(fmla <- paste(___, "~", paste(___, collapse = " + ")))

# Calculate the mean and variance of the outcome
(mean_bikes <- ___)
(var_bikes <- ___)

# Fit the model
bike_model <- ___

# Call glance
(perf <- ___)

# Calculate pseudo-R-squared
(pseudoR2 <- ___)
Editează și rulează codul