Redukcja skośności zmiennych
Teraz przekształcisz kolumny zbioru wholesale przy użyciu transformacji Boxa-Coxa, a następnie przeanalizujesz wykres par zmiennych, aby sprawdzić, czy skośność rozkładów została zmniejszona i czy stały się one bardziej zbliżone do normalnego. To kluczowy krok, który pozwala algorytmowi K-means poprawnie zbiegać i wykrywać jednorodne grupy (czyli klastry lub segmenty) obserwacji.
Moduł stats z biblioteki scipy jest już załadowany, a zbiór danych wholesale zaimportowano jako DataFrame biblioteki pandas.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Zdefiniuj niestandardową funkcję transformacji Boxa-Coxa, którą można zastosować do DataFrame'a biblioteki
pandas. - Zastosuj tę funkcję do zbioru danych
wholesale. - Narysuj wykres par zmiennych dla przekształconych danych.
- Wyświetl wykres.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define custom Box Cox transformation function
def boxcox_df(x):
x_boxcox, _ = stats.___(x)
return x_boxcox
# Apply the function to the `wholesale` dataset
wholesale_boxcox = ___.___(boxcox_df, axis=0)
# Plot the pairwise relationships between the transformed variables
sns.___(___, diag_kind='kde')
# Display the chart
plt.___()