特徴量の標準化
kNN 距離を計算する前に、scale() 関数を使って特徴量の入力を標準化しておくことが重要です。標準化により、平均や分散が大きい特徴量が kNN 距離スコアに過度な影響を与えないようにできます。
この演習はコースの一部です
Rで学ぶ異常検知入門
演習の手順
summary()関数をwineデータに適用し、pHとalcoholの平均、最小値、最大値を確認します。scale()関数を使って、wineの標準化版データwine_scaledを作成します。summary()関数をwine_scaledに適用し、平均値や範囲が変化していることを確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Without standardization, features have different scales
summary(wine)
# Standardize the wine columns
wine_scaled <- ___
# Standardized features have similar means and quartiles
___(___)