Fără intermediari
Acum știi cum să încarci date în Spark prin pandas, dar probabil te întrebi de ce să folosești pandas deloc? N-ar fi mai simplu să citești direct un fișier text în Spark? Bineînțeles că da!
Din fericire, SparkSession are un atribut .read cu mai multe metode pentru a citi date din surse diferite în Spark DataFrames. Cu ajutorul acestora, poți crea un DataFrame dintr-un fișier .csv exact ca în pandas!
Variabila file_path este un șir de caractere cu calea către fișierul airports.csv. Acest fișier conține informații despre aeroporturi din întreaga lume.
În spațiul tău de lucru este disponibilă o SparkSession numită spark.
Acest exercițiu face parte din cursul
Fundamente PySpark
Instrucțiuni pentru exercițiu
- Folosește metoda
.read.csv()pentru a crea un Spark DataFrame numitairports- Primul argument este
file_path - Transmite argumentul
header=Truepentru ca Spark să știe că trebuie să preia numele coloanelor din primul rând al fișierului.
- Primul argument este
- Afișează acest DataFrame apelând
.show().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()