始める無料で始める

ロジスティック回帰によるベースライン分類器

直近の2つのレッスンでは、Machine Learningの面接において特徴量選択がいかに重要かを学びました。面接でよく問われるもう一つのテーマが特徴量エンジニアリングで、モデル性能の向上にどう役立つかという点です。

この演習では、Chapter 1のloan_dataデータセットに対して新しい特徴量を作成し、特徴量エンジニアリングの前後でロジスティック回帰モデルの正解率を比較します。テストラベルと、目的変数Loan Statusの予測値を比較して評価します。

必要なパッケージはすべてインポート済みです:matplotlib.pyplotpltseabornsnssklearn.linear_modelLogisticRegressionsklearn.model_selectiontrain_test_split、そしてsklearn.metricsaccuracy_score

特徴量エンジニアリングはモデリング前の前処理ステップとして位置づけられます。 Machine learning pipeline

この演習はコースの一部です

Pythonで学ぶMachine Learning面接対策

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)

# Instantiate
logistic = ____()

# Fit
logistic.____(____, ____)

# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))
コードを編集して実行