始める無料で始める

特徴量の標準化

kNN 距離を計算する前に、scale() 関数を使って特徴量の入力を標準化しておくことが重要です。標準化により、平均や分散が大きい特徴量が kNN 距離スコアに過度な影響を与えないようにできます。

この演習はコースの一部です

Rで学ぶ異常検知入門

コースを見る

演習の手順

  • summary() 関数を wine データに適用し、pHalcohol の平均、最小値、最大値を確認します。
  • scale() 関数を使って、wine の標準化版データ wine_scaled を作成します。
  • summary() 関数を wine_scaled に適用し、平均値や範囲が変化していることを確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Without standardization, features have different scales
summary(wine)

# Standardize the wine columns
wine_scaled <- ___

# Standardized features have similar means and quartiles
___(___)
コードを編集して実行