始める無料で始める

データの前処理

クラスタリング前の前処理は、より正確にセグメンテーションするための下準備になります。前処理の一種である特徴量スケーリングは、データに含まれる独立変数を固定範囲(例:0-1 や 0-100)に標準化する手法です。

この演習では、performance として読み込まれた学生の成績データセットの parental_level_of_education 列と writing_score 列に対してクラスタリングを行います。まず、前処理なしで k-means モデルを作成して実行します。次に、特徴量スケーリングで前処理を行ってから、同様に実行します。

プライベート k-means モデルは diffprivlib.models から KMeans としてインポート済みです。スケーリング用の StandardScaler と次元削減の PCAsklearn からインポート済みです。

この演習はコースの一部です

Pythonで学ぶデータプライバシーと匿名化

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
コードを編集して実行