Înlocuirea datelor lipsă din setul de date de credit
Acum ar trebui să verifici dacă există date lipsă. Dacă găsești valori lipsă în loan_status, nu vei putea folosi acele date pentru a prezice probabilitatea de nerambursare, deoarece nu ai ști dacă împrumutul a fost rambursat sau nu. Valorile lipsă din person_emp_length nu ar fi la fel de problematice, însă tot ar cauza erori în antrenarea modelului.
Așadar, verifică dacă există date lipsă în coloana person_emp_length și înlocuiește orice valoare lipsă cu mediana.
Setul de date cr_loan a fost încărcat în spațiul de lucru.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Afișează un array cu numele coloanelor care conțin date lipsă, folosind
.isnull(). - Afișează primele cinci rânduri din setul de date care au valori lipsă pentru
person_emp_length. - Înlocuiește datele lipsă cu mediana tuturor valorilor de vechime în câmpul muncii, folosind
.fillna(). - Creează o histogramă a coloanei
person_emp_lengthpentru a verifica distribuția.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()