Načtení CSV do DataFrame
V předchozím cvičení jsi viděl/a, jak vytvořit DataFrame z RDD. Nejběžnějším způsobem vytváření DataFrames je ale načtení dat z CSV souboru. V tomto cvičení vytvoříš PySpark DataFrame ze souboru people.csv, který máš k dispozici jako proměnnou file_path, a ověříš, že vzniklý objekt je skutečně PySpark DataFrame.
Nezapomeň, že ve svém pracovním prostředí už máš k dispozici SparkSession spark a proměnnou file_path (cestu k souboru people.csv).
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř DataFrame z proměnné
file_path, která obsahuje cestu k souborupeople.csv. - Ověř, že výstup je PySpark DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))