İmputasyonları görselleştir
İmputasyonları analiz etmek ve en iyisini seçmek, çokça deneme gerektiren bir iştir. İmputasyon yaparken verinin önyargılı hale gelmediğinden emin olmak önemlidir. Bu son iki egzersizde, ortalama, medyan, mod ve sabit değer doldurma yöntemleriyle 4 farklı imputasyon oluşturdun.
Bu egzersizde, daha önce imputasyon yaptığın DataFrame'lerin dağılım grafiğini (scatterplot) oluşturacaksın. Bunu yapmak için, anahtarları başlıkları olan bir sözlükte DataFrame'leri toplayacaksın.
diabetes_mean, diabetes_median, diabetes_mode ve diabetes_constant DataFrame'leri senin için yüklendi.
Bu egzersiz, kursun bir parçasıdır
Python'da Eksik Verilerle Çalışma
Egzersiz talimatları
- 2 satır ve 2 sütunluk bir grafik oluşturarak 4 alt grafik (subplot) oluştur.
- Her anahtarı ilgili DataFrame ile eşleyerek
imputationssözlüğünü oluştur. axesveimputationsüzerinde döngü kur veimputationsiçindeki her DataFrame'i çiz.- Rengi
nullityolarak ayarla ve her alt grafiğin başlığını imputasyonun adına göre belirle.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()