Kom igångKom igång gratis

RDD:er från externa datakällor

PySpark kan enkelt skapa RDD:er från filer som lagras på externa lagringsenheter, till exempel HDFS (Hadoop Distributed File System), Amazon S3-buckets och liknande. Det vanligaste sättet att skapa RDD:er är dock från filer i det lokala filsystemet. Den här metoden tar en filsökväg och läser in filen som en samling rader. I den här övningen skapar du en RDD från filsökvägen (file_path) för filen README.md, som redan finns tillgänglig i din arbetsyta.

Kom ihåg att SparkContext sc redan är tillgänglig i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skriv ut file_path i PySpark-skalet.
  • Skapa en RDD med namnet fileRDD från file_path.
  • Skriv ut typen av den skapade fileRDD.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Redigera och kör kod