ÎncepețiÎncepe gratuit

Fără intermediari

Acum știi cum să încarci date în Spark prin pandas, dar probabil te întrebi de ce să folosești pandas deloc? N-ar fi mai simplu să citești direct un fișier text în Spark? Bineînțeles că da!

Din fericire, SparkSession are un atribut .read cu mai multe metode pentru a citi date din surse diferite în Spark DataFrames. Cu ajutorul acestora, poți crea un DataFrame dintr-un fișier .csv exact ca în pandas!

Variabila file_path este un șir de caractere cu calea către fișierul airports.csv. Acest fișier conține informații despre aeroporturi din întreaga lume.

În spațiul tău de lucru este disponibilă o SparkSession numită spark.

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește metoda .read.csv() pentru a crea un Spark DataFrame numit airports
    • Primul argument este file_path
    • Transmite argumentul header=True pentru ca Spark să știe că trebuie să preia numele coloanelor din primul rând al fișierului.
  • Afișează acest DataFrame apelând .show().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Editează și rulează codul