Попередня обробка даних RFM
Ми завантажили набір даних із RFM-значеннями, які ви раніше обчислили, як datamart_rfm. Оскільки змінні мають перекіс розподілу та різні шкали, тепер ви приберете перекіс і нормалізуєте їх.
Бібліотеку pandas завантажено як pd, а numpy — як np. Приділіть трохи часу, щоб дослідити datamart_rfm у консолі.
Ця вправа є частиною курсу
Сегментація клієнтів у Python
Інструкції до вправи
- Застосуйте логарифмічне перетворення, щоб прибрати перекіс у
datamart_rfm, і збережіть результат якdatamart_log. - Ініціалізуйте екземпляр
StandardScaler()якscalerі підженіть його на данихdatamart_log. - Трансформуйте
data, виконавши масштабування та центрування за допомогоюscaler. - Створіть pandas DataFrame з 'datamart_normalized', додавши індекс і назви стовпців із
datamart_rfm.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Unskew the data
datamart_log = np.____(____)
# Initialize a standard scaler and fit it
scaler = ____()
scaler.____(____)
# Scale and center the data
datamart_normalized = ____.____(____)
# Create a pandas DataFrame
datamart_normalized = pd.____(data=____, index=____.index, columns=____.columns)