乳がん予測のロジスティック回帰
前の演習では、データの初期評価を行いました。今回は、乳がんデータセットに対してロジスティック回帰モデル用の学習データとテストデータの分割を定義します。これはあらゆるMachine Learningモデルを実行するうえでの重要な第一歩です。
乳がんデータセットは sklearn に含まれるサンプルで、患者のさまざまな特徴量と、乳がんの有無を示す目的変数が含まれます。データはディクショナリ形式で提供され、主な特徴量は data という配列、目的変数は target という配列に格納されています。つまり、cancer_data.data が特徴量、cancer_data.target が目的変数です。サンプルデータは cancer_data として読み込まれており、pandas は pd として利用できます。LogisticRegression は sklearn.linear_model から利用可能です。
この演習はコースの一部です
PythonでMachine Learningを使ってCTRを予測する
演習の手順
- それぞれ
dataとtargetを使って、Xとyを定義してください。 X_trainとy_trainは、それぞれXとyの最初の300件にします。X_trainはX[:300]を使います。X_testとy_testは、それぞれXとyの残り(最初の300件を除いた部分)にします。X_testはX[300:]を使います。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]