Kom igångKom igång gratis

Definiera ett schema

Vi har läst in scheman på flera olika sätt. Nu ska vi definiera ett schema direkt. Vi använder följande dataordlista:

Variabel Beskrivning
age Individens ålder
education_num Utbildningsnivå efter examen
marital_status Civilstånd
occupation Yrke
income Kategorisk inkomst

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Definiera dataschemat med kolumnnamnen (age, education_num, marital_status, occupation och income) och kolumntyperna, och ange ett kommatecken som argument till sep=.
  • Läs in data från en kommaavgränsad fil med namnet adult_reduced_100.csv.
  • Skriv ut schemat för den resulterande DataFrame:n.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Redigera och kör kod