Tvorba klasifikátoru pro diagnostiku diabetu
Budeme pracovat s datasetem Pima Indians Diabetes, kde cílem je pomocí logistické regrese předpovědět, zda má daná osoba diabetes. Dataset obsahuje 8 příznaků a jeden cílový atribut. Data jsou rozdělená na trénovací a testovací sadu a předem načtená jako X_train, y_train, X_test a y_test.
Instance StandardScaler() je předem definovaná jako scaler a instance LogisticRegression() jako lr.
Toto cvičení je součástí kurzu
Redukce dimenzionality v Pythonu
Pokyny k cvičení
- Natrénuj scaler na trénovacích příznacích a rovnou je transformuj v jednom kroku.
- Natrénuj model logistické regrese na škálovaných trénovacích datech.
- Škáluj testovací příznaky.
- Předpověz přítomnost diabetu na škálované testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit the scaler on the training features and transform these in one go
X_train_std = scaler.____(____)
# Fit the logistic regression model on the scaled training data
lr.____(____, ____)
# Scale the test features
X_test_std = scaler.____(____)
# Predict diabetes presence on the scaled test set
y_pred = lr.____(____)
# Prints accuracy metrics and feature coefficients
print(f"{accuracy_score(y_test, y_pred):.1%} accuracy on test set.")
print(dict(zip(X.columns, abs(lr.coef_[0]).round(2))))