Odstranění chybějících dat
Chybějící data ve sloupci person_emp_length jsi nahradil/a, ale v předchozím cvičení jsi viděl/a, že chybějící hodnoty obsahuje i sloupec loan_int_rate.
Podobně jako chybějící data ve sloupci loan_status i chybějící hodnoty ve sloupci loan_int_rate mohou při předpovědích způsobovat problémy.
Protože úrokové sazby stanovuje přímo tvoje společnost, jsou chybějící hodnoty v tomto sloupci velmi neobvyklé. Mohlo by jít o chyby vzniklé při načítání dat, ale nelze to s jistotou určit. Pro tuto chvíli je nejlepší tyto záznamy před dalším postupem odstranil pomocí metody .drop().
Datová sada cr_loan je načtena v pracovním prostředí.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vypiš počet záznamů, které obsahují chybějící hodnoty pro úrokovou sazbu.
- Vytvoř pole indexů řádků s chybějící úrokovou sazbou a pojmenuj ho
indices. - Odstraň záznamy s chybějící úrokovou sazbou a výsledek ulož do proměnné
cr_loan_clean.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the number of nulls
print(____[____].____().____())
# Store the array on indices
____ = ____[____[____].____].____
# Save the new data without missing data
____ = ____.____(____)