Zacznij terazZacznij za darmo

Wykrywanie wartości odstających

Bardzo ważnym aspektem poprawnego przetwarzania danych jest wykrywanie wartości odstających. W pytaniach rekrutacyjnych z uczenia maszynowego często pojawia się kwestia ich lokalizowania i obsługi. Jednym z najprostszych sposobów wykrycia wartości odstających jest wizualizacja graficzna.

Po znalezieniu i uzupełnieniu brakujących danych, kolejnym niezbędnym krokiem w przetwarzaniu wstępnym jest identyfikacja wartości odstających i decyzja, co z nimi zrobić.

Istnieje wiele bibliotek umożliwiających wizualizację wartości odstających. W tym ćwiczeniu użyjesz seaborn, aby narysować jednowymiarowe i wielowymiarowe wykresy pudełkowe dla wybranych kolumn zbioru loan_data.

Wszystkie niezbędne biblioteki zostały już zaimportowane.

Gdzie jesteś w potoku przetwarzania?

Machine learning pipeline

To ćwiczenie jest częścią kursu

Ćwiczenie pytań rekrutacyjnych z uczenia maszynowego w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import modules
import matplotlib.pyplot as plt
import seaborn as sns

# Univariate and multivariate boxplots
fig, ax =plt.subplots(1,2)
sns.____(y=____['_____'], ax=ax[0])
sns.____(x='Loan Status', y='Annual Income', data=____, ax=ax[1])
plt.show()
Edytuj i uruchom kod