Histogramy
Zbiór danych loan_data jest wczytany do twojego środowiska pracy. Wcześniej analizowałeś zmienne kategoryczne przy użyciu funkcji CrossTable(). Teraz czas przyjrzeć się zmiennym ciągłym – pomoże to wykryć potencjalne wartości odstające lub nieoczekiwane struktury w danych.
W tym celu poeksperymentujemy z funkcją hist(), aby zbadać rozkład liczby pożyczek dla różnych klientów.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w R
Instrukcje do ćwiczenia
- Użyj funkcji hist(), aby utworzyć histogram z jednym argumentem:
loan_data$loan_amnt. Przypisz wynik do nowego obiektu o nazwiehist_1. - Użyj
$breaksna obiekciehist_1, aby uzyskać więcej informacji o przedziałach histogramu. Znajomość położenia przedziałów jest ważna – jeśli są źle dobrane, histogram może wprowadzać w błąd. - Zmień liczbę przedziałów w
hist_1na 200, korzystając z argumentubreaks. Dodatkowo nadaj osi X etykietę"Loan amount"za pomocą argumentuxlab, a całemu wykresowi tytuł"Histogram of the loan amount"za pomocą argumentumain. Zapisz wynik do obiektuhist_2. Zastanów się, dlaczego szczyty pojawiają się akurat w tych miejscach.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create histogram of loan_amnt: hist_1
# Print locations of the breaks in hist_1
# Change number of breaks and add labels: hist_2
hist_2 <- hist(loan_data$loan_amnt, breaks = ___, xlab = "___",
main = "___")