Bisiklet kiralama sayılarını tahmin etmek için bir model kur
Bu egzersizde, bir saatte kiralanan bisiklet sayısını; hava durumu, gün tipi (resmi tatil, iş günü veya hafta sonu) ve günün saatiyle ilişkilendirerek tahmin eden bir model kuracaksın. Modeli Temmuz ayına ait veriler üzerinde eğiteceksin.
Veri çerçevesinde şu sütunlar var:
cnt: o saatte kiralanan bisiklet sayısı (çıktı)hr: günün saati (0-23, faktör olarak)holiday: TRUE/FALSEworkingday: Resmi tatil veya hafta sonu değilse TRUE, aksi halde FALSEweathersit: kategorik, "Clear to partly cloudy"/"Light Precipitation"/"Misty"temp: normalize edilmiş Celsius sıcaklığıatemp: normalize edilmiş "hissedilen" sıcaklık (Celsius)hum: normalize edilmiş nemwindspeed: normalize edilmiş rüzgâr hızıinstant: zaman indeksi -- veri kümesinin başlangıcından itibaren saat sayısı (değişken değil)mnthveyr: ay ve yıl indeksleri (değişken değil)
Sayı verileri için model kurarken glm() (docs) kullanırken family = poisson veya family = quasipoisson belirtmen gerektiğini unutma.
Girdi değişkenleri çok olduğundan, pratik olması için çıktıyı ve girdileri değişkenlerde belirteceğiz ve model formülünü temsil eden bir dizeyi birleştirmek için paste() (docs) kullanacağız.
bikesJuly veri çerçevesi kullanımına hazır. Çıktı değişkeninin ve girdi değişkenlerinin adları da sırasıyla outcome ve vars değişkenleri olarak yüklendi.
Bu egzersiz, kursun bir parçasıdır
R'de Supervised Learning: Regresyon
Egzersiz talimatları
- Girdilerin bir fonksiyonu olarak
cnt'i ifade edenfmlaformülünü oluşturmak için boşlukları doldur. Yazdır. bikesJuly$cnt'in ortalamasını (mean()) ve varyansını (var()) hesapla.- poisson mı yoksa quasipoisson regresyonu mu kullanmalısın?
glm()ilebikesJulyverisine bir model uydur:bike_model.- Modelin uyum istatistiklerine bakmak için
glance()kullan.glance()çıktısınıperfdeğişkenine ata. - Modelin sözde-R-kare değerini hesapla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# bikesJuly is available
str(bikesJuly)
# The outcome column
outcome
# The inputs to use
vars
# Create the formula string for bikes rented as a function of the inputs
(fmla <- paste(___, "~", paste(___, collapse = " + ")))
# Calculate the mean and variance of the outcome
(mean_bikes <- ___)
(var_bikes <- ___)
# Fit the model
bike_model <- ___
# Call glance
(perf <- ___)
# Calculate pseudo-R-squared
(pseudoR2 <- ___)