Kom igångKom igång gratis

Bygg en differentiellt privat klassificerare

I den här övningen ska du bygga och träna en privat Gaussian Naive Bayes-modell på Penguin-datamängden för att klassificera om en pingvin är hane eller hona.

K-anonymitet fungerar dåligt med högdimensionella eller varierade datamängder på grund av dess stora teoretiska och empiriska begränsningar – det så kallade "dimensionalitetens förbannelse". Ju fler särdrag eller dimensioner som tillkommer, desto mer data krävs för att generalisera korrekt, och behovet växer exponentiellt. Det är en av anledningarna till att differentiell integritet är den föredragna integritetsmodellen i dag. Epsilon är oberoende av all bakgrundsinformation och sätter en "gräns" för den känsliga informationen.

DataFrame:en är inläst som penguin_df och uppdelad i X_train, y_train, X_test och y_test. Den privata modellklassen har importerats som dp_GaussianNB.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Skapa en dp_GaussianNB-klassificerare utan parametrar.
  • Träna den skapade modellen på data utan några parametrar.
  • Beräkna den privata modellens poäng baserat på testdata.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Built the private classifier without parameters
dp_clf = ____

# Fit the model to the data
____(X_train, y_train)

# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))
Redigera och kör kod