Obsługa wartości odstających
W poprzednim ćwiczeniu przekonałeś się, jak przydatna może być wizualizacja wartości odstających podczas rozmowy kwalifikacyjnej z uczenia maszynowego. Innym wygodnym sposobem ich obsługi jest obliczenie wyniku Z, który wyznacza próg dla wartości odstających na poziomie mniej więcej +/-3 odchylenia standardowego od średniej.
W tym ćwiczeniu użyjesz modułu scipy.stats, aby obliczyć wynik Z za pomocą funkcji stats.zscore(), oraz funkcji mstats.winsorize(), aby zastąpić wartości odstające techniką zwaną Winsoryzacją.
Przypomnij sobie z lekcji wideo, że punkty powyżej i/lub poniżej 1,5-krotności IQR należy traktować jako potencjalne wartości odstające. W ostatnim kroku tego ćwiczenia wartość ta wynosi 2120.
Odpowiednie pakiety zostały już zaimportowane, a kolumny liczbowe i kategoryczne zbioru loan_data zostały wydzielone i zapisane odpowiednio jako numeric_cols i categoric_cols.

To ćwiczenie jest częścią kursu
Ćwiczenie pytań rekrutacyjnych z uczenia maszynowego w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())
# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)
# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)
# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())