PCA を使う
この演習では、wine データセットに PCA を適用し、モデルの精度を高められるかを確かめます。
この演習はコースの一部です
Pythonで学ぶMachine Learningの前処理
演習の手順
PCAオブジェクトをインスタンス化します。wineから特徴量(X)とラベル(y)を定義し、ラベルには"Type"列を使います。- データリークが起きないように注意して
X_trainとX_testに PCA を適用し、変換後の値をそれぞれpca_X_trainとpca_X_testに保存します。 - 各主成分がどれだけ分散を説明しているかを確認するため、
pcaの.explained_variance_ratio_属性を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Instantiate a PCA object
pca = ____()
# Define the features and labels from the wine dataset
X = wine.drop(____, ____)
y = wine["Type"]
X_train, X_test, y_train, y_test = train_test_split(X, y, stratify=y, random_state=42)
# Apply PCA to the wine dataset X vector
pca_X_train = ___.____(____)
pca_X_test = ___.____(____)
# Look at the percentage of variance explained by the different components
print(____)