分析に向けたデータの準備
nycflights13 データセットの一部を flights として読み込んであります。これはニューヨーク市から出発するフライトの情報を含みます。目的地への到着が遅れるかどうかを予測したいのですが、その前に分析用にデータを準備する必要があります。
専門家チームとモデルの目標を検討した結果、次の変数をモデルに使うことにしました: flight, sched_dep_time, dep_delay, sched_arr_time, carrier, origin, dest, distance, date, arrival。
また、as.Date() を使って日付を mutate() し、character 型の変数を factor に変換します。
最後に、データを train と test のデータセットに分割します。
この演習はコースの一部です
Rで学ぶ特徴量エンジニアリング
演習の手順
- すべての character 型の変数を factor に変換します。
- flights データを test と train に分割します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
flights <- flights %>%
select(flight, sched_dep_time, dep_delay, sched_arr_time, carrier, origin, dest, distance, date, arrival) %>%
# Tranform all character-type variables to factors
mutate(date = as.Date(date), ___(where(is.character), as.factor))
# Split the flights data into test and train sets
set.seed(246)
split <- flights %>% initial_split(prop = 3/4, strata = arrival)
test <- ___(split)
train <- ___(split)
test %>% select(arrival) %>% table() %>% prop.table()
train %>% select(arrival) %>% table() %>% prop.table()