Imputare cu KNN
Seturile de date conțin aproape întotdeauna caracteristici corelate între ele. De aceea, este important să le luăm în considerare atunci când imputăm valorile lipsă. Modelele de învățare automată folosesc caracteristicile din DataFrame pentru a identifica corelații și tipare, apoi prezic valorile unei caracteristici selectate.
Unul dintre cele mai simple și mai eficiente modele este K Nearest Neighbors (K Cei Mai Apropiați Vecini). Acesta identifică „K" puncte cât mai similare cu punctele de date existente, pentru a imputa valorile lipsă.
În acest exercițiu, DataFrame-ul diabetes a fost deja încărcat pentru tine. Folosește pachetul fancyimpute pentru a imputa valorile lipsă din DataFrame-ul diabetes.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă în Python
Instrucțiuni pentru exercițiu
- Importă
KNNdinfancyimpute. - Copiază
diabetesîndiabetes_knn_imputed. - Creează un obiect
KNN()și atribuie-l variabileiknn_imputer. - Imputează DataFrame-ul
diabetes_knn_imputed.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___