Läsa in data i PySpark-skalet
I PySpark uttrycker vi våra beräkningar genom operationer på distribuerade samlingar som automatiskt paralleliseras över klustret. I föregående övning såg du ett exempel på hur man läser in en lista som paralleliserade samlingar. I den här övningen ska du läsa in data från en lokal fil i PySpark-skalet.
Du har redan en SparkContext sc och variabeln file_path (som innehåller sökvägen till filen README.md) tillgängliga i din arbetsmiljö.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Läs in den lokala textfilen
README.mdi PySpark-skalet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load a local file into PySpark shell
lines = sc.____(file_path)