Fehlende Daten löschen
Du hast zuvor gesehen, dass der Zinssatz (int_rate) im Datensatz loan_data vom Kunden abhängt. Leider fehlen bei einigen Beobachtungen die Zinssätze. Du sollst nun feststellen, wie viele Zinssätze fehlen, und sie anschließend löschen.
In dieser Übung verwendest du die Funktion which(), um einen Index der Zeilen zu erstellen, die ein NA enthalten. Diesen Index nutzt du dann, um Zeilen mit NAs zu löschen.
Diese Übung ist Teil des Kurses
<Kurs>Kreditrisikomodellierung in R</Kurs>Übungsanweisungen
- Schau dir mit summary() die Anzahl der fehlenden Eingaben für die Variable
int_ratean. - Verwende
which()undis.na(), um einen Index der Beobachtungen ohne erfassten Zinssatz zu erstellen. Speichere das Ergebnis im Objektna_index. - Erstelle einen neuen Datensatz namens
loan_data_delrow_na, der die Beobachtungen mit fehlenden Zinssätzen nicht enthält. - Erinner dich daran, dass wir eine Kopie von
loan_datanamensloan_data_delcol_naerstellt haben. Anstatt die Beobachtungen mit fehlenden Zinssätzen zu löschen, entferne hier die gesamte Spalteint_rate, indem du sie aufNULLsetzt.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Look at summary of loan_data
# Get indices of missing interest rates: na_index
na_index <-
# Remove observations with missing interest rates: loan_data_delrow_na
___ <- loan_data[-___, ]
# Make copy of loan_data
loan_data_delcol_na <- loan_data
# Delete interest rate column from loan_data_delcol_na