Hur många saknade värden finns det?
En av de första sakerna du bör kontrollera med ett nytt dataset är om det finns saknade värden, och hur många det i så fall rör sig om.
Du kan använda are_na() för att räkna saknade värden, men det effektivaste sättet är att använda funktionen n_miss(). Den returnerar det totala antalet saknade värden i datan.
Med funktionen pct_miss kan du sedan beräkna andelen saknade värden, uttryckt i procent. Den berättar hur stor procentandel av värdena som saknas.
Du kan även ta reda på komplementet – alltså hur många kompletta värden som finns – med hjälp av n_complete och pct_complete.
Den här övningen är en del av kursen
Hantera saknade värden i R
Övningsinstruktioner
Använd exempeldataramen med längder och vikter, dat_hw:
- Använd
n_miss()på dataramendat_hwför att räkna det totala antalet saknade värden i dataramen. - Använd
n_miss()på variabelndat_hw$weightför att räkna antalet saknade värden i den. - Använd på samma sätt
prop_miss(),n_complete()ochprop_complete()för att beräkna andelen saknade värden samt antalet och andelen kompletta värden för dataramen och variablerna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Use n_miss() to count the total number of missing values in dat_hw
n_miss(___)
# Use n_miss() on dat_hw$weight to count the total number of missing values
n_miss(___$___)
# Use n_complete() on dat_hw to count the total number of complete values
n_complete(___)
# Use n_complete() on dat_hw$weight to count the total number of complete values
___(___$___)
# Use prop_miss() and prop_complete() on dat_hw to count the total number of missing values in each of the variables
prop_miss(____)
prop_complete(___)