Logistisk regression för bröstcancer
I förra övningen gjorde vi en första utvärdering av datan. I den här övningen definierar du en tränings- och testuppdelning för en logistisk regressionsmodell på ett bröstcancerdataset. Det är ett viktigt första steg inför alla maskininlärningsmodeller.
Bröstcancerdatasetet är ett exempeldataset från sklearn med olika särdrag från patienter samt ett målvärde som anger om patienten har bröstcancer eller inte. Datan är lagrad i ett dictionaryformat där huvuddatan finns i en array kallad data och målvärdena i en array kallad target. Det innebär att cancer_data.data innehåller särdragen och cancer_data.target innehåller målvärdena. Exempeldatan är inläst som cancer_data tillsammans med pandas som pd. LogisticRegression är tillgänglig via sklearn.linear_model.
Den här övningen är en del av kursen
Förutsäga CTR med maskininlärning i Python
Övningsinstruktioner
- Definiera både
Xochymed hjälp avdatarespektivetarget. - Tilldela
X_trainochy_trainde första 300 samplen avXrespektiveymed hjälp avX[:300]förX_train. - Tilldela
X_testochy_testresterande sampel avXrespektivey(exklusive de första 300) med hjälp avX[300:]förX_test.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]