ÎncepețiÎncepe gratuit

Regresie logistică pentru cancerul de sân

În exercițiul anterior, am realizat o primă explorare a datelor. În acest exercițiu, vei defini o împărțire în set de antrenament și set de testare pentru un model de regresie logistică aplicat pe un set de date despre cancerul de sân. Acesta este un prim pas esențial în rularea oricărui model de învățare automată.

Setul de date despre cancerul de sân este un set de date exemplu din sklearn, care conține diverse caracteristici ale pacienților și o valoare țintă ce indică dacă pacientul are sau nu cancer de sân. Datele sunt stocate într-un format de dicționar: datele principale se află într-un array numit data, iar valorile țintă – într-un array numit target. Astfel, cancer_data.data reprezintă caracteristicile, iar cancer_data.target – valorile țintă. Datele sunt încărcate ca cancer_data, împreună cu pandas ca pd. LogisticRegression este disponibil prin sklearn.linear_model.

Acest exercițiu face parte din cursul

Predicția CTR cu Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Definește atât X, cât și y folosind data, respectiv target.
  • Atribuie lui X_train și y_train primele 300 de eșantioane din X și y, folosind X[:300] pentru X_train.
  • Atribuie lui X_test și y_test restul eșantioanelor din X și y (excluzând primele 300), folosind X[300:] pentru X_test.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define X and y 
X = cancer_data.____
y = cancer_data.____

# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____] 
Editează și rulează codul