始める無料で始める

次元と特徴量の情報量

あなたは銀行に勤めており、さまざまな人に対するローンに関する情報を収集しています。上司は、このデータを使って顧客を複数のクレジットスコア区分に分類できるか検討を始めてほしいと考えています。利用可能なデータのサンプルが credit_df に読み込まれています。まず、このデータにいくつの特徴量があるかを確認したいと思います。また、顧客を異なるクレジット区分に分類するうえで役に立たない特徴量も特定したいと考えています。

tidyverse パッケージはすでに読み込まれています。

この演習はコースの一部です

Rによる次元削減

コースを見る

演習の手順

  • credit_df に含まれる特徴量の数を求めてください。
  • credit_df の各特徴量の分散を計算してください。
  • 分散がゼロの特徴量を特定し、column_to_remove に代入してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Find the number of features
___ %>% ___()

# Compute each column variance
credit_df %>% 
  ___(___(___(), ~ ___(., na.rm = TRUE))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "variance")

# Assign the zero-variance column
column_to_remove <- "___"
コードを編集して実行