Bez zbytečných mezikroků
Teď už víš, jak dostat data do Sparku přes pandas – ale možná tě napadá otázka, proč pandas vůbec používat? Nebylo by jednodušší načíst textový soubor přímo do Sparku? Jasně, že ano!
Naštěstí má tvůj SparkSession atribut .read, který nabízí několik metod pro načítání různých datových zdrojů do Spark DataFrames. Pomocí nich můžeš vytvořit DataFrame ze souboru .csv úplně stejně jako s běžnými pandas DataFrames!
Proměnná file_path je řetězec s cestou k souboru airports.csv. Tento soubor obsahuje informace o různých letištích po celém světě.
V tvém pracovním prostředí je k dispozici SparkSession s názvem spark.
Toto cvičení je součástí kurzu
Foundations of PySpark
Pokyny k cvičení
- Pomocí metody
.read.csv()vytvoř Spark DataFrame s názvemairports- Prvním argumentem je
file_path - Předej argument
header=True, aby Spark věděl, že má vzít názvy sloupců z prvního řádku souboru.
- Prvním argumentem je
- Vypiš tento DataFrame zavoláním
.show().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()