Zápis do souboru
Ve videu jsi viděl/a, že data se často načítají do MPP databáze, jako je Redshift, aby byla dostupná pro analýzu.
Typický postup spočívá v zápisu dat do sloupcových datových souborů. Ty se pak nahrají do úložiště a odtud je lze zkopírovat do datového skladu. V případě Amazon Redshift by tímto úložištěm bylo například S3.
Prvním krokem je zapsat soubor ve správném formátu. V tomto cvičení použiješ formát Apache Parquet.
V tvém pracovním prostředí máš k dispozici PySpark DataFrame film_sdf a pandas DataFrame film_pdf.
Toto cvičení je součástí kurzu
Introduction to Data Engineering
Pokyny k cvičení
- Zapiš
pandasDataFramefilm_pdfdo souboru ve formátu parquet s názvem"films_pdf.parquet". - Zapiš PySpark DataFrame
film_sdfdo souboru ve formátu parquet s názvem"films_sdf.parquet".
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")