Kom igångKom igång gratis

Läsa in data i PySpark-skalet

I PySpark uttrycker vi våra beräkningar genom operationer på distribuerade samlingar som automatiskt paralleliseras över klustret. I föregående övning såg du ett exempel på hur man läser in en lista som paralleliserade samlingar. I den här övningen ska du läsa in data från en lokal fil i PySpark-skalet.

Du har redan en SparkContext sc och variabeln file_path (som innehåller sökvägen till filen README.md) tillgängliga i din arbetsmiljö.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Läs in den lokala textfilen README.md i PySpark-skalet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Redigera och kör kod