Definiera ett schema
Att definiera ett schema på förhand förbättrar datakvaliteten och prestandan vid inläsning. Som nämndes i lektionen ska vi skapa ett enkelt schema för att läsa in följande kolumner:
- Name
- Age
- City
Kolumnerna Name och City är av typen StringType() och kolumnen Age är av typen IntegerType().
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Importera
*från biblioteketpyspark.sql.types. - Definiera ett nytt schema med metoden
StructType. - Definiera ett
StructFieldförname,ageochcity. Varje fält ska motsvara rätt datatyp och inte varanullable.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the pyspark.sql.types library
____
# Define a new schema using the StructType method
people_schema = ____([
# Define a StructField for each field
StructField('name', ____, False),
____('____', IntegerType(), ____)
____
])