ÎncepețiÎncepe gratuit

Înlocuirea datelor lipsă din setul de date de credit

Acum ar trebui să verifici dacă există date lipsă. Dacă găsești valori lipsă în loan_status, nu vei putea folosi acele date pentru a prezice probabilitatea de nerambursare, deoarece nu ai ști dacă împrumutul a fost rambursat sau nu. Valorile lipsă din person_emp_length nu ar fi la fel de problematice, însă tot ar cauza erori în antrenarea modelului.

Așadar, verifică dacă există date lipsă în coloana person_emp_length și înlocuiește orice valoare lipsă cu mediana.

Setul de date cr_loan a fost încărcat în spațiul de lucru.

Acest exercițiu face parte din cursul

Modelarea Riscului de Credit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Afișează un array cu numele coloanelor care conțin date lipsă, folosind .isnull().
  • Afișează primele cinci rânduri din setul de date care au valori lipsă pentru person_emp_length.
  • Înlocuiește datele lipsă cu mediana tuturor valorilor de vechime în câmpul muncii, folosind .fillna().
  • Creează o histogramă a coloanei person_emp_length pentru a verifica distribuția.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Print a null value column array
print(____.columns[____.____().any()])

# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())

# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)

# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()
Editează și rulează codul