Imputace chybějících hodnot pomocí percentilů
V tomto cvičení si procvičíš imputaci chybějících hodnot. Na rozdíl od předchozího cvičení ale místo průměrů použiješ percentily. Percentily jsou skvělým nástrojem pro konzervativní imputace. Imputace chybějících hodnot ve sloupci pomocí percentilů zahrnuje tyto kroky:
- Odstraň chybějící hodnoty ze sledovaného sloupce.
- Vypočítej, například, 70. percentil čísel ze sloupce, ze kterého jsi právě odstranil/a chybějící hodnoty.
- Hodnota 70. nejhoršího percentilu závisí na tom, ze kterého sloupce percentil počítáš:
- Například velký objem aktiv se považuje za pozitivní, takže nízký objem aktiv je horší. 70. nejhorší percentil aktiv je ve skutečnosti jejich 30. percentil.
- Analogicky, vysoký objem závazků se považuje za negativní. Takže 70. nejhorší percentil závazků je jednoduše jeho 70. percentil.
pandas je načtený s aliasem pd a NumPy s aliasem np. K dispozici máš pandas DataFrame s názvem dataset. Obsahuje sloupec "Total Current Liabilities", ve kterém se nacházejí chybějící hodnoty.
Toto cvičení je součástí kurzu
Analýza finančních výkazů v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Impute missing value with 70th percentile non-missing values of company
impute_by_company = ___
# Impute missing value with 70th percentile non-missing values of industry
impute_by_comp_type = ____
print(impute_by_company)
print(impute_by_comp_type)