Definiowanie schematu
Wczytywaliśmy już schematy na różne sposoby. Teraz zdefiniujemy schemat bezpośrednio, korzystając ze słownika danych:
| Zmienna | Opis |
|---|---|
| age | Wiek osoby |
| education_num | Wykształcenie według stopnia |
| marital_status | Stan cywilny |
| occupation | Zawód |
| income | Kategoryczny poziom dochodu |
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Zdefiniuj schemat danych, podając nazwy kolumn (
age,education_num,marital_status,occupationiincome) oraz ich typy, a dla argumentusep=ustaw przecinek. - Wczytaj dane z pliku z wartościami rozdzielanymi przecinkami o nazwie
adult_reduced_100.csv. - Wyświetl schemat powstałego DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____