Začněte nyníZačněte zdarma

Imputace metodou KNN

Datasety obsahují features, které spolu navzájem korelují. Proto je důležité brát je v úvahu při imputaci chybějících hodnot. Modely strojového učení využívají features v DataFrame k hledání korelací a vzorů a k predikci vybrané feature.

Jedním z nejjednodušších a nejefektivnějších modelů je K nejbližších sousedů (K Nearest Neighbors). Tento model najde „K" bodů nejpodobnějších stávajícím datovým bodům a pomocí nich imputuje chybějící hodnoty.

V tomto cvičení je DataFrame diabetes už načtený. Pomocí balíčku fancyimpute imputuj chybějící hodnoty v DataFrame diabetes.

Toto cvičení je součástí kurzu

Dealing with Missing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj KNN z fancyimpute.
  • Zkopíruj diabetes do diabetes_knn_imputed.
  • Vytvoř objekt KNN() a přiřaď ho do knn_imputer.
  • Imputuj DataFrame diabetes_knn_imputed.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
Upravit a spustit kód