Začněte nyníZačněte zdarma

Předzpracování dat

Předzpracování dat před clusteringem může přispět k přesnější segmentaci. Jednou z technik předzpracování je škálování příznaků – metoda, která standardizuje nezávislé příznaky v datech do pevně daného rozsahu, např. 0–1 nebo 0–100.

V tomto cvičení provedeš clustering na sloupcích parental_level_of_education a writing_score v datasetu výkonnosti studentů, který je načtený jako performance. Nejprve vytvoříš a spustíš model k-means bez jakéhokoli předzpracování. Potom totéž zopakuješ, ale tentokrát data předzpracuješ pomocí škálování příznaků.

Privátní model k-means byl importován jako KMeans z diffprivlib.models. Scaler StandardScaler a redukce dimenzionality PCA byly importovány ze sklearn.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build the differentially private k-means model
model = KMeans(____)

# Fit the model to the data
____

# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)
Upravit a spustit kód