În căutarea valorilor lipsă previzibile
Dacă datele lipsesc complet aleatoriu, atunci nu ar trebui să poți prezice când o variabilă are valori lipsă pe baza restului datelor. Prin urmare, dacă poți prezice absența valorilor, înseamnă că datele nu lipsesc complet aleatoriu. Să folosim funcția glm() pentru a ajusta o regresie logistică și a identifica valorile lipsă în funcție de accesibilitate, în variabila mort creată anterior. Dacă nu găsești nicio structură în datele lipsă – adică variabilele de pantă nu sunt semnificative – nu înseamnă că ai demonstrat că datele lipsesc aleatoriu, dar această ipoteză rămâne plauzibilă.
Acest exercițiu face parte din cursul
Procesarea scalabilă a datelor în R
Instrucțiuni pentru exercițiu
- Creează o variabilă care indică dacă
"borrower_race"are valori lipsă (egal cu 9) în datele ipotecare. - Creează o variabilă de tip factor pentru coloana
"affordability". - Regresează
affordability_factorfață deborrower_race_indși aplică funcțiasummary()pe rezultat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))