Regresie logistică pentru cancerul de sân
În exercițiul anterior, am realizat o primă explorare a datelor. În acest exercițiu, vei defini o împărțire în set de antrenament și set de testare pentru un model de regresie logistică aplicat pe un set de date despre cancerul de sân. Acesta este un prim pas esențial în rularea oricărui model de învățare automată.
Setul de date despre cancerul de sân este un set de date exemplu din sklearn, care conține diverse caracteristici ale pacienților și o valoare țintă ce indică dacă pacientul are sau nu cancer de sân. Datele sunt stocate într-un format de dicționar: datele principale se află într-un array numit data, iar valorile țintă – într-un array numit target. Astfel, cancer_data.data reprezintă caracteristicile, iar cancer_data.target – valorile țintă. Datele sunt încărcate ca cancer_data, împreună cu pandas ca pd. LogisticRegression este disponibil prin sklearn.linear_model.
Acest exercițiu face parte din cursul
Predicția CTR cu Machine Learning în Python
Instrucțiuni pentru exercițiu
- Definește atât
X, cât șiyfolosinddata, respectivtarget. - Atribuie lui
X_trainșiy_trainprimele 300 de eșantioane dinXșiy, folosindX[:300]pentruX_train. - Atribuie lui
X_testșiy_testrestul eșantioanelor dinXșiy(excluzând primele 300), folosindX[300:]pentruX_test.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]