Logistická regrese pro rakovinu prsu
V předchozím cvičení jsme provedli první průzkum dat. V tomto cvičení definuješ trénovací a testovací rozdělení pro model logistické regrese na datasetu rakoviny prsu. Jde o důležitý první krok při práci s jakýmkoli modelem strojového učení.
Dataset rakoviny prsu je ukázkový dataset z knihovny sklearn obsahující různé příznaky pacientů a cílovou hodnotu udávající, zda daný pacient rakovinu prsu má, nebo nemá. Data jsou ve formátu slovníku, kde hlavní data jsou uložena v poli data a cílové hodnoty v poli target. Příznaky tedy najdeš v cancer_data.data a cílové hodnoty v cancer_data.target. Ukázková data jsou načtena jako cancer_data, k dispozici je také pandas jako pd. LogisticRegression je dostupná přes sklearn.linear_model.
Toto cvičení je součástí kurzu
Předpovídání CTR pomocí Machine Learning v Pythonu
Pokyny k cvičení
- Definuj
Xaypomocídataatarget. - Přiřaď do
X_trainay_trainprvních 300 vzorků zXay– proX_trainpoužijX[:300]. - Přiřaď do
X_testay_testzbývající vzorky zXay(tedy vše po prvních 300) – proX_testpoužijX[300:].
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]