ÎncepețiÎncepe gratuit

Gestionarea valorilor aberante

În exercițiul anterior, ai văzut cât de utilă poate fi vizualizarea valorilor aberante într-un interviu de machine learning. O altă metodă practică de gestionare a acestora este calculul scorului Z, care definește un prag pentru valorile aberante situate la aproximativ +/-3 abateri standard față de medie.

În acest exercițiu, vei folosi modulul scipy.stats pentru a calcula scorul Z cu funcția stats.zscore(), și funcția mstats.winsorize() pentru a înlocui valorile aberante printr-o tehnică numită Winsorizing.

Reține din lecția video că punctele situate peste și/sau sub de 1,5 ori intervalul intercuartilic (IQR) sunt considerate potențiale valori aberante. Pentru ultimul pas al acestui exercițiu, acea valoare este 2120.

Pachetele necesare au fost deja importate, iar coloanele numerice și categoriale din loan_data au fost extrase și salvate ca numeric_cols, respectiv categoric_cols.

Machine learning pipeline

Acest exercițiu face parte din cursul

Exersează întrebări de interviu pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
Editează și rulează codul