Läsa in folkräkningsdata
Nu skapar vi din första PySpark DataFrame! Filen adult_reduced.csv innehåller en gruppering av vuxna baserad på olika demografiska kategorier. Datan är hämtad från den amerikanska folkräkningen och innehåller totalt 32 562 grupperingar av vuxna.
Vi läser in CSV-filen och undersöker det resulterande schemat.
Dataordlista:
| Variabel | Beskrivning |
|---|---|
| age | Individens ålder |
| education_num | Utbildningsnivå |
| marital_status | Civilstånd |
| occupation | Yrke |
| income | Inkomstkategori |
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Skapa en PySpark DataFrame från filen
"adult_reduced.csv"med hjälp av metodenspark.read.csv(). - Visa den resulterande DataFrame:n.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____