Kom igångKom igång gratis

Resamplingtekniker

I den förra övningen såg du hur obalanserade klasser kan påverka resultaten i din förväxlingsmatris. I den här övningen får du öva på resamplingtekniker för att utforska hur olika resamplingmetoder kan påverka en datamängd med klassimbalans, som den vi såg i loan_data. Med sklearn:s funktion resample() kallas det upsampling när du matchar antalet rader i majoritetsklassen, och downsampling när du matchar antalet rader i minoritetsklassen.

Du skapar både en upsamplad och en downsamplad version av datamängden loan_data, tillämpar logistisk regression på båda och utvärderar sedan prestandan. Träningsdatan och dess etiketter som motsvarar deny är delmängder som innehåller endast minoritetsklassen, och approve motsvarar majoritetsklassen.

Ett tränings/test-uppdelningsobjekt för prediktion har sparats i arbetsytan som X_test och finns tillgängligt i övningarna.

Den här övningen är en del av kursen

Öva på maskininlärningsintervjufrågor i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])

# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False,  n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])
Redigera och kör kod