Regresja logistyczna do wykrywania raka piersi
W poprzednim ćwiczeniu przeprowadziliśmy wstępną analizę danych. Teraz zdefiniujesz podział na zbiór treningowy i testowy dla modelu regresji logistycznej na zbiorze danych dotyczącym raka piersi. To ważny pierwszy krok przed uruchomieniem każdego modelu uczenia maszynowego.
Zbiór danych o raku piersi pochodzi z biblioteki sklearn i zawiera różne cechy pacjentów oraz zmienną docelową wskazującą, czy dany pacjent ma raka piersi. Dane są przechowywane w formacie słownika: główne dane znajdują się w tablicy data, a wartości docelowe – w tablicy target. Oznacza to, że cancer_data.data zawiera cechy, a cancer_data.target – etykiety. Dane przykładowe są wczytane jako cancer_data, biblioteka pandas jest dostępna jako pd, a LogisticRegression jest dostępna z modułu sklearn.linear_model.
To ćwiczenie jest częścią kursu
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie
Instrukcje do ćwiczenia
- Zdefiniuj
Xiy, używając odpowiedniodataitarget. - Przypisz do
X_trainiy_trainpierwsze 300 próbek zXiy, używającX[:300]dlaX_train. - Przypisz do
X_testiy_testpozostałe próbki zXiy(pomijając pierwsze 300), używającX[300:]dlaX_test.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]