始める無料で始める

決定木

これまでの3章で、Machine Learningの面接で問われる多くの側面に対応するためのさまざまなテクニックを学んできました。この章では、面接で作成や説明を求められるモデルが汎化できているか、正しく評価されているか、そして候補の中から適切に選ばれているかを確認するための方法を紹介します。

この演習では、loan_data データセットに対する決定木のハイパーパラメータチューニングを行います。 ここでは、追加の二分割を行うために必要な最小サンプル数を表す min_samples_split と、木の深さを制御する max_depth をチューニングします。木を深くすると分割が増え、データからより多くの情報を捉えられます。

特徴量行列 X と目的変数ラベル y はすでにインポートされています。

今回もMachine Learningパイプラインの全ステップを実施することに注意してください!

Machine learning pipeline

この演習はコースの一部です

Pythonで学ぶMachine Learning面接対策

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import modules
from sklearn.tree import ____
from sklearn.metrics import accuracy_score

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)

# Instantiate, Fit, Predict
loans_clf = ____() 
loans_clf.____(____, ____)
y_pred = loans_clf.____(____)

# Evaluation metric
print("Decision Tree Accuracy: {}".format(____(____,____)))
コードを編集して実行