Factoriseren, ronde twee
In de vorige oefening leerde je hoe je een databestand kunt importeren met het commando read_sav(). Bij SPSS-bestanden kan het ook gebeuren dat sommige geïmporteerde variabelen de klasse labelled hebben. Dit gebeurt om alle labelinformatie te behouden die oorspronkelijk aanwezig was in de bestanden .sav en .por. Het is aan te raden deze variabelen te forceren (oftewel om te zetten) naar factors of andere standaard R-klassen.
De data voor deze oefening bevat informatie over werknemers en hun demografische en economische kenmerken (Bron: QRiE). De data is te vinden op de volgende URL:
https://assets.datacamp.com/production/course_1478/datasets/employee.sav
Deze oefening maakt deel uit van de cursus
Gevorderd data importeren in R
Oefeninstructies
- Importeer de SPSS-data direct vanaf de URL en sla het resulterende data frame op als
work. - Toon de samenvatting van de kolom
GENDERvanwork. Deze informatie geeft je niet veel nuttigs, toch? - Zet de kolom
GENDERinworkom naar een factor, de klasse waarmee je categorische variabelen in R aanduidt. Gebruikas_factor(). - Toon opnieuw de samenvatting van de kolom
GENDER. Deze keer is de uitvoer veel logischer.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# haven is already loaded
# Import SPSS data from the URL: work
# Display summary of work$GENDER
# Convert work$GENDER to a factor
# Display summary of work$GENDER again