Jak wyglądają twoje dane? (I)
Do tej pory skupiałeś się na tworzeniu nowych cech i rozwiązywaniu problemów z danymi. Inżynieria cech pozwala też wyciągnąć jak najwięcej z danych, które już posiadasz, i skuteczniej wykorzystać je podczas budowania modeli uczenia maszynowego.
Wiele algorytmów zakłada, że dane mają rozkład normalny lub przynajmniej że wszystkie kolumny są w tej samej skali. W praktyce rzadko tak jest – jedna cecha może być mierzona w tysiącach dolarów, a inna w latach. W tym ćwiczeniu stworzysz wykresy, aby zbadać rozkłady wybranych kolumn numerycznych z DataFrame so_survey_df, zapisanego jako so_numeric_df.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a histogram
____
plt.show()