Rastgele bir test/eğitim bölmesi oluşturma
Sonraki birkaç egzersizde ggplot2 paketindeki mpg verisini kullanacaksın. Bu veri, farklı yıllardaki çeşitli otomobil marka ve modellerinin özelliklerini açıklar. Amaç, şehir içi yakıt verimliliğini otoyol yakıt verimliliğinden tahmin etmektir.
Bu egzersizde mpg veri kümesini bir eğitim kümesine mpg_train (verinin %75'i) ve bir test kümesine mpg_test (verinin %25'i) olarak böleceksin. Bunu yapmanın bir yolu, runif() (docs) fonksiyonunu kullanarak 0 ile 1 arasında düzgün dağılımlı rastgele sayılardan oluşan bir sütun üretmektir.
Eğer boyutu \(N\) olan bir dframe veri kümen varsa ve \(N\)'in yaklaşık \(100 * X\)% (burada \(X\) 0 ile 1 arasındadır) büyüklüğünde rastgele bir alt küme istiyorsan:
- Düzgün dağılımlı rastgele sayılardan bir vektör üret:
gp = runif(N). dframe[gp < X,]yaklaşık olarak istenen boyutta olacaktır.dframe[gp >= X,]ise tamamlayıcı küme olacaktır.
Bu egzersiz, kursun bir parçasıdır
R'de Supervised Learning: Regresyon
Egzersiz talimatları
nrow(docs) fonksiyonunu kullanarakmpgveri çerçevesindeki satır sayısını al. Bu sayıyıNdeğişkenine ata ve yazdır.- N'in %75'inin yaklaşık kaç satır ettiğini hesapla. Bunu
targetdeğişkenine ata ve yazdır. runif()kullanarakNuzunluğunda, düzgün dağılımlı rastgele sayılardan oluşangpadlı bir vektör üret.gp'yi kullanarakmpg'yimpg_trainvempg_testolarak böl (yaklaşık %75'impg_train'de olacak şekilde).nrow()ilempg_trainvempg_test'in boyutlarını kontrol et. Yaklaşık doğru boyuttalar mı?
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# mpg is available
summary(mpg)
dim(mpg)
# Use nrow to get the number of rows in mpg (N) and print it
(N <- ___)
# Calculate how many rows 75% of N should be and print it
# Hint: use round() to get an integer
(target <- ___)
# Create the vector of N uniform random variables: gp
gp <- ___
# Use gp to create the training set: mpg_train (75% of data) and mpg_test (25% of data)
mpg_train <- ___
mpg_test <- ___
# Use nrow() to examine mpg_train and mpg_test
___
___