RDD:er från externa datakällor
PySpark kan enkelt skapa RDD:er från filer som lagras på externa lagringsenheter, till exempel HDFS (Hadoop Distributed File System), Amazon S3-buckets och liknande. Det vanligaste sättet att skapa RDD:er är dock från filer i det lokala filsystemet. Den här metoden tar en filsökväg och läser in filen som en samling rader. I den här övningen skapar du en RDD från filsökvägen (file_path) för filen README.md, som redan finns tillgänglig i din arbetsyta.
Kom ihåg att SparkContext sc redan är tillgänglig i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skriv ut
file_pathi PySpark-skalet. - Skapa en RDD med namnet
fileRDDfrånfile_path. - Skriv ut typen av den skapade
fileRDD.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))