Zacznij terazZacznij za darmo

Obsługa wartości odstających

W poprzednim ćwiczeniu przekonałeś się, jak przydatna może być wizualizacja wartości odstających podczas rozmowy kwalifikacyjnej z uczenia maszynowego. Innym wygodnym sposobem ich obsługi jest obliczenie wyniku Z, który wyznacza próg dla wartości odstających na poziomie mniej więcej +/-3 odchylenia standardowego od średniej.

W tym ćwiczeniu użyjesz modułu scipy.stats, aby obliczyć wynik Z za pomocą funkcji stats.zscore(), oraz funkcji mstats.winsorize(), aby zastąpić wartości odstające techniką zwaną Winsoryzacją.

Przypomnij sobie z lekcji wideo, że punkty powyżej i/lub poniżej 1,5-krotności IQR należy traktować jako potencjalne wartości odstające. W ostatnim kroku tego ćwiczenia wartość ta wynosi 2120.

Odpowiednie pakiety zostały już zaimportowane, a kolumny liczbowe i kategoryczne zbioru loan_data zostały wydzielone i zapisane odpowiednio jako numeric_cols i categoric_cols.

Machine learning pipeline

To ćwiczenie jest częścią kursu

Ćwiczenie pytań rekrutacyjnych z uczenia maszynowego w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
Edytuj i uruchom kod