Definiera ett schema
Vi har läst in scheman på flera olika sätt. Nu ska vi definiera ett schema direkt. Vi använder följande dataordlista:
| Variabel | Beskrivning |
|---|---|
| age | Individens ålder |
| education_num | Utbildningsnivå efter examen |
| marital_status | Civilstånd |
| occupation | Yrke |
| income | Kategorisk inkomst |
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Definiera dataschemat med kolumnnamnen (
age,education_num,marital_status,occupationochincome) och kolumntyperna, och ange ett kommatecken som argument tillsep=. - Läs in data från en kommaavgränsad fil med namnet
adult_reduced_100.csv. - Skriv ut schemat för den resulterande DataFrame:n.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____