Kom igångKom igång gratis

Skriva till en fil

I videon såg du att filer ofta läses in i en MPP-databas som Redshift för att göra dem tillgängliga för analys.

Det typiska arbetsflödet är att skriva data till kolumnbaserade datafiler. Dessa datafiler laddas sedan upp till ett lagringssystem, varifrån de kan kopieras in i datalagret. I fallet med Amazon Redshift skulle lagringssystemet till exempel vara S3.

Det första steget är att skriva en fil i rätt format. I den här övningen väljer du filformatet Apache Parquet.

Det finns en PySpark DataFrame kallad film_sdf och en pandas DataFrame kallad film_pdf i din arbetsyta.

Den här övningen är en del av kursen

Introduktion till datatekniker

Visa kurs

Övningsinstruktioner

  • Skriv pandas DataFrame:en film_pdf till en parquet-fil med namnet "films_pdf.parquet".
  • Skriv PySpark DataFrame:en film_sdf till en parquet-fil med namnet "films_sdf.parquet".

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Redigera och kör kod