Skriva till en fil
I videon såg du att filer ofta läses in i en MPP-databas som Redshift för att göra dem tillgängliga för analys.
Det typiska arbetsflödet är att skriva data till kolumnbaserade datafiler. Dessa datafiler laddas sedan upp till ett lagringssystem, varifrån de kan kopieras in i datalagret. I fallet med Amazon Redshift skulle lagringssystemet till exempel vara S3.
Det första steget är att skriva en fil i rätt format. I den här övningen väljer du filformatet Apache Parquet.
Det finns en PySpark DataFrame kallad film_sdf och en pandas DataFrame kallad film_pdf i din arbetsyta.
Den här övningen är en del av kursen
Introduktion till datatekniker
Övningsinstruktioner
- Skriv pandas DataFrame:en
film_pdftill en parquet-fil med namnet"films_pdf.parquet". - Skriv PySpark DataFrame:en
film_sdftill en parquet-fil med namnet"films_sdf.parquet".
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")