Bygg en diabetesklassificerare
Du kommer att använda Pima Indians-diabetesdatasetet för att förutsäga om en person har diabetes med hjälp av logistisk regression. Datasetet innehåller 8 särdrag och en målvariabel. Data har delats upp i ett tränings- och ett testset och är förinstallerade som X_train, y_train, X_test och y_test.
En instans av StandardScaler() har fördefinierades som scaler och en instans av LogisticRegression() som lr.
Den här övningen är en del av kursen
Dimensionsreduktion i Python
Övningsinstruktioner
- Anpassa skalaren på träningssärdragens data och transformera dem i ett steg.
- Anpassa den logistiska regressionsmodellen på de skalade träningsdata.
- Skala testsärdragens data.
- Förutsäg förekomsten av diabetes på det skalade testsetet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Fit the scaler on the training features and transform these in one go
X_train_std = scaler.____(____)
# Fit the logistic regression model on the scaled training data
lr.____(____, ____)
# Scale the test features
X_test_std = scaler.____(____)
# Predict diabetes presence on the scaled test set
y_pred = lr.____(____)
# Prints accuracy metrics and feature coefficients
print(f"{accuracy_score(y_test, y_pred):.1%} accuracy on test set.")
print(dict(zip(X.columns, abs(lr.coef_[0]).round(2))))