Kom igångKom igång gratis

Logistisk regression för bröstcancer

I förra övningen gjorde vi en första utvärdering av datan. I den här övningen definierar du en tränings- och testuppdelning för en logistisk regressionsmodell på ett bröstcancerdataset. Det är ett viktigt första steg inför alla maskininlärningsmodeller.

Bröstcancerdatasetet är ett exempeldataset från sklearn med olika särdrag från patienter samt ett målvärde som anger om patienten har bröstcancer eller inte. Datan är lagrad i ett dictionaryformat där huvuddatan finns i en array kallad data och målvärdena i en array kallad target. Det innebär att cancer_data.data innehåller särdragen och cancer_data.target innehåller målvärdena. Exempeldatan är inläst som cancer_data tillsammans med pandas som pd. LogisticRegression är tillgänglig via sklearn.linear_model.

Den här övningen är en del av kursen

Förutsäga CTR med maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Definiera både X och y med hjälp av data respektive target.
  • Tilldela X_train och y_train de första 300 samplen av X respektive y med hjälp av X[:300] för X_train.
  • Tilldela X_test och y_test resterande sampel av X respektive y (exklusive de första 300) med hjälp av X[300:] för X_test.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
Redigera och kör kod