Začněte nyníZačněte zdarma

Techniky převzorkování

V předchozím cvičení jsi viděl/a, jak nevyvážené třídy mohou ovlivnit výsledky matice záměn. V tomto cvičení si procvičíš techniky převzorkování a prozkoumáš, jaký vliv mohou různé přístupy k převzorkování mít na dataset s nevyváženými třídami, jako je loan_data. Pomocí funkce resample() z knihovny sklearn se technika, při které přizpůsobujeme počet řádků majoritní třídě, nazývá upsampling, zatímco přizpůsobení počtu řádků minoritní třídě se nazývá downsampling.

Vytvoříš jak upsamplovanou, tak downsamplovanou verzi datasetu loan_data, na obě aplikuješ logistickou regresi a následně vyhodnotíš výsledky. Trénovací data a jejich popisky odpovídající hodnotě deny jsou podmnožinou obsahující pouze minoritní třídu, popisky approve pak odpovídají majoritní třídě.

Objekt train/test split pro tvorbu predikcí je uložen v pracovním prostředí jako X_test a můžeš ho v cvičeních rovnou použít.

Toto cvičení je součástí kurzu

Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])

# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False,  n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])
Upravit a spustit kód