Jak vypadají tvoje data? (I)
Doposud ses soustředil/a na vytváření nových příznaků a řešení problémů v datech. Feature engineering ale také pomáhá vytěžit maximum z dat, která už máš, a využít je efektivněji při tvorbě modelů strojového učení.
Mnoho algoritmů předpokládá, že tvá data mají normální rozdělení, nebo alespoň že všechny sloupce jsou na stejné škále. To ale často není pravda – například jeden příznak může být v tisících dolarů, zatímco jiný v počtu let. V tomto cvičení vytvoříš grafy, které ti pomohou prozkoumat rozdělení hodnot v některých numerických sloupcích DataFramu so_survey_df, uloženého jako so_numeric_df.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a histogram
____
plt.show()