ÎncepețiÎncepe gratuit

Evitarea dezechilibrelor de clasă

Unele seturi de date conțin rezultate foarte dezechilibrate – cum ar fi un set de date despre o boală rară. La împărțirea aleatorie, poți ajunge la o diviziune nefericită. Imaginează-ți că toate observațiile rare se află în setul de testare și niciuna în cel de antrenament. Asta ar compromite întregul proces de antrenare!

Din fericire, funcția initial_split() oferă o soluție. În acest exercițiu vei observa și rezolva aceste așa-numite dezechilibre de clasă.

Există deja cod furnizat pentru a crea obiectul de împărțire diabetes_split cu 75% date de antrenament și 25% date de testare.

Acest exercițiu face parte din cursul

Machine Learning cu modele bazate pe arbori în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Preparation
set.seed(9888)
diabetes_split <- initial_split(diabetes, prop = 0.75)

# Proportion of 'yes' outcomes in the training data
counts_train <- table(training(___)$outcome)
prop_yes_train <- counts_train["___"] / sum(counts_train)

# Proportion of 'yes' outcomes in the test data
counts_test <- table(___)
prop_yes_test <- ___ / sum(___)

paste("Proportion of positive outcomes in training set:", round(prop_yes_train, 2))
paste("Proportion of positive outcomes in test set:", round(prop_yes_test, 2))
Editează și rulează codul