Imputace metodou KNN
Datasety obsahují features, které spolu navzájem korelují. Proto je důležité brát je v úvahu při imputaci chybějících hodnot. Modely strojového učení využívají features v DataFrame k hledání korelací a vzorů a k predikci vybrané feature.
Jedním z nejjednodušších a nejefektivnějších modelů je K nejbližších sousedů (K Nearest Neighbors). Tento model najde „K" bodů nejpodobnějších stávajícím datovým bodům a pomocí nich imputuje chybějící hodnoty.
V tomto cvičení je DataFrame diabetes už načtený. Pomocí balíčku fancyimpute imputuj chybějící hodnoty v DataFrame diabetes.
Toto cvičení je součástí kurzu
Dealing with Missing Data in Python
Pokyny k cvičení
- Importuj
KNNzfancyimpute. - Zkopíruj
diabetesdodiabetes_knn_imputed. - Vytvoř objekt
KNN()a přiřaď ho doknn_imputer. - Imputuj DataFrame
diabetes_knn_imputed.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___