Kom igångKom igång gratis

Undersampling av träningsdata

Nu är det dags att undersampla träningsdatamängden själv med några rader kod från Pandas. När undersamplingen är klar kan du kontrollera värdenas antal för loan_status för att verifiera resultaten.

X_y_train, count_nondefault och count_default är redan inlästa i arbetsytan. De har skapats med följande kod:

X_y_train = pd.concat([X_train.reset_index(drop = True),
                       y_train.reset_index(drop = True)], axis = 1)
count_nondefault, count_default = X_y_train['loan_status'].value_counts()

.value_counts() för den ursprungliga träningsdatan skrivs ut automatiskt.

Den här övningen är en del av kursen

Kreditriskmodellering i Python

Visa kurs

Övningsinstruktioner

  • Skapa datamängder med icke-defaults och defaults och lagra dem som nondefaults respektive defaults.
  • Sampla nondefaults till samma antal som count_default och lagra resultatet som nondefaults_under.
  • Konkatenera nondefaults och defaults med .concat() och lagra det som X_y_train_under.
  • Skriv ut .value_counts() för lånestatus i den nya datamängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create data sets for defaults and non-defaults
____ = ____[____[____] == 0]
____ = ____[____[____] == 1]

# Undersample the non-defaults
____ = nondefaults.sample(____)

# Concatenate the undersampled nondefaults with defaults
____ = pd.____([____.reset_index(drop = True),
                             ____.reset_index(drop = True)], axis = 0)

# Print the value counts for loan status
print(____[____].____())
Redigera och kör kod