Kom igångKom igång gratis

Läsa in folkräkningsdata

Nu skapar vi din första PySpark DataFrame! Filen adult_reduced.csv innehåller en gruppering av vuxna baserad på olika demografiska kategorier. Datan är hämtad från den amerikanska folkräkningen och innehåller totalt 32 562 grupperingar av vuxna.

Vi läser in CSV-filen och undersöker det resulterande schemat.

Dataordlista:

Variabel Beskrivning
age Individens ålder
education_num Utbildningsnivå
marital_status Civilstånd
occupation Yrke
income Inkomstkategori

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en PySpark DataFrame från filen "adult_reduced.csv" med hjälp av metoden spark.read.csv().
  • Visa den resulterande DataFrame:n.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Read in the CSV
census_adult = ____.____.____(____)

# Show the DataFrame
census_adult.____
Redigera och kör kod