Předzpracování dat
Předzpracování dat před clusteringem může přispět k přesnější segmentaci. Jednou z technik předzpracování je škálování příznaků – metoda, která standardizuje nezávislé příznaky v datech do pevně daného rozsahu, např. 0–1 nebo 0–100.
V tomto cvičení provedeš clustering na sloupcích parental_level_of_education a writing_score v datasetu výkonnosti studentů, který je načtený jako performance. Nejprve vytvoříš a spustíš model k-means bez jakéhokoli předzpracování. Potom totéž zopakuješ, ale tentokrát data předzpracuješ pomocí škálování příznaků.
Privátní model k-means byl importován jako KMeans z diffprivlib.models. Scaler StandardScaler a redukce dimenzionality PCA byly importovány ze sklearn.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)