Začněte nyníZačněte zdarma

Bez zbytečných mezikroků

Teď už víš, jak dostat data do Sparku přes pandas – ale možná tě napadá otázka, proč pandas vůbec používat? Nebylo by jednodušší načíst textový soubor přímo do Sparku? Jasně, že ano!

Naštěstí má tvůj SparkSession atribut .read, který nabízí několik metod pro načítání různých datových zdrojů do Spark DataFrames. Pomocí nich můžeš vytvořit DataFrame ze souboru .csv úplně stejně jako s běžnými pandas DataFrames!

Proměnná file_path je řetězec s cestou k souboru airports.csv. Tento soubor obsahuje informace o různých letištích po celém světě.

V tvém pracovním prostředí je k dispozici SparkSession s názvem spark.

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pomocí metody .read.csv() vytvoř Spark DataFrame s názvem airports
    • Prvním argumentem je file_path
    • Předej argument header=True, aby Spark věděl, že má vzít názvy sloupců z prvního řádku souboru.
  • Vypiš tento DataFrame zavoláním .show().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Upravit a spustit kód