Začněte nyníZačněte zdarma

Odstranění chybějících dat

Chybějící data ve sloupci person_emp_length jsi nahradil/a, ale v předchozím cvičení jsi viděl/a, že chybějící hodnoty obsahuje i sloupec loan_int_rate.

Podobně jako chybějící data ve sloupci loan_status i chybějící hodnoty ve sloupci loan_int_rate mohou při předpovědích způsobovat problémy.

Protože úrokové sazby stanovuje přímo tvoje společnost, jsou chybějící hodnoty v tomto sloupci velmi neobvyklé. Mohlo by jít o chyby vzniklé při načítání dat, ale nelze to s jistotou určit. Pro tuto chvíli je nejlepší tyto záznamy před dalším postupem odstranil pomocí metody .drop().

Datová sada cr_loan je načtena v pracovním prostředí.

Toto cvičení je součástí kurzu

Credit Risk Modeling in Python

Zobrazit kurz

Pokyny k cvičení

  • Vypiš počet záznamů, které obsahují chybějící hodnoty pro úrokovou sazbu.
  • Vytvoř pole indexů řádků s chybějící úrokovou sazbou a pojmenuj ho indices.
  • Odstraň záznamy s chybějící úrokovou sazbou a výsledek ulož do proměnné cr_loan_clean.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the number of nulls
print(____[____].____().____())

# Store the array on indices
____ = ____[____[____].____].____

# Save the new data without missing data
____ = ____.____(____)
Upravit a spustit kód