शुरू करेंमुफ़्त में शुरू करें

विश्लेषण के लिए अपना डेटा तैयार करना

आप nycflights13 डेटासेट के एक संस्करण को देखेंगे, जिसे flights के रूप में लोड किया गया है। इसमें न्यूयॉर्क सिटी से उड़ने वाली फ़्लाइट्स की जानकारी है। आप यह भविष्यवाणी करने में रुचि रखते हैं कि वे अपने गंतव्य पर देर से पहुँचेंगी या नहीं, लेकिन पहले आपको विश्लेषण के लिए डेटा तैयार करना होगा।

विशेषज्ञों की टीम के साथ हमारे मॉडल लक्ष्यों पर चर्चा करने के बाद, आपने अपने मॉडल के लिए निम्न वैरिएबल चुने: flight, sched_dep_time, dep_delay, sched_arr_time, carrier, origin, dest, distance, date, arrival.

आप as.Date() का उपयोग करके date को mutate() भी करेंगे और character टाइप वैरिएबल्स को factors में बदलेंगे।

अंत में, आप डेटा को train और test डेटासेट्स में विभाजित करेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • सभी character-टाइप वैरिएबल्स को factors में बदलें।
  • flights डेटा को test और train सेट्स में विभाजित करें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

flights <- flights %>%
  select(flight, sched_dep_time, dep_delay, sched_arr_time, carrier, origin, dest, distance, date, arrival) %>%

# Tranform all character-type variables to factors
  mutate(date = as.Date(date), ___(where(is.character), as.factor))

# Split the flights data into test and train sets
set.seed(246)
split <- flights %>% initial_split(prop = 3/4, strata = arrival)
test <- ___(split)
train <- ___(split)

test %>% select(arrival) %>% table() %>% prop.table()
train %>% select(arrival) %>% table() %>% prop.table()
कोड संपादित करें और चलाएँ