ÎncepețiÎncepe gratuit

În căutarea valorilor lipsă previzibile

Dacă datele lipsesc complet aleatoriu, atunci nu ar trebui să poți prezice când o variabilă are valori lipsă pe baza restului datelor. Prin urmare, dacă poți prezice absența valorilor, înseamnă că datele nu lipsesc complet aleatoriu. Să folosim funcția glm() pentru a ajusta o regresie logistică și a identifica valorile lipsă în funcție de accesibilitate, în variabila mort creată anterior. Dacă nu găsești nicio structură în datele lipsă – adică variabilele de pantă nu sunt semnificative – nu înseamnă că ai demonstrat că datele lipsesc aleatoriu, dar această ipoteză rămâne plauzibilă.

Acest exercițiu face parte din cursul

Procesarea scalabilă a datelor în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o variabilă care indică dacă "borrower_race" are valori lipsă (egal cu 9) în datele ipotecare.
  • Creează o variabilă de tip factor pentru coloana "affordability".
  • Regresează affordability_factor față de borrower_race_ind și aplică funcția summary() pe rezultat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9

# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])

# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))
Editează și rulează codul