Začněte nyníZačněte zdarma

Načtení CSV do DataFrame

V předchozím cvičení jsi viděl/a, jak vytvořit DataFrame z RDD. Nejběžnějším způsobem vytváření DataFrames je ale načtení dat z CSV souboru. V tomto cvičení vytvoříš PySpark DataFrame ze souboru people.csv, který máš k dispozici jako proměnnou file_path, a ověříš, že vzniklý objekt je skutečně PySpark DataFrame.

Nezapomeň, že ve svém pracovním prostředí už máš k dispozici SparkSession spark a proměnnou file_path (cestu k souboru people.csv).

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř DataFrame z proměnné file_path, která obsahuje cestu k souboru people.csv.
  • Ověř, že výstup je PySpark DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Upravit a spustit kód