始める無料で始める

乳がん予測のロジスティック回帰

前の演習では、データの初期評価を行いました。今回は、乳がんデータセットに対してロジスティック回帰モデル用の学習データとテストデータの分割を定義します。これはあらゆるMachine Learningモデルを実行するうえでの重要な第一歩です。

乳がんデータセットは sklearn に含まれるサンプルで、患者のさまざまな特徴量と、乳がんの有無を示す目的変数が含まれます。データはディクショナリ形式で提供され、主な特徴量は data という配列、目的変数は target という配列に格納されています。つまり、cancer_data.data が特徴量、cancer_data.target が目的変数です。サンプルデータは cancer_data として読み込まれており、pandaspd として利用できます。LogisticRegressionsklearn.linear_model から利用可能です。

この演習はコースの一部です

PythonでMachine Learningを使ってCTRを予測する

コースを見る

演習の手順

  • それぞれ datatarget を使って、Xy を定義してください。
  • X_trainy_train は、それぞれ Xy の最初の300件にします。X_trainX[:300] を使います。
  • X_testy_test は、それぞれ Xy の残り(最初の300件を除いた部分)にします。X_testX[300:] を使います。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
コードを編集して実行