外部データセットからの RDD
PySpark は、HDFS(Hadoop Distributed File System)や Amazon S3 バケットなどの外部ストレージに保存されたファイルから、簡単に RDD を作成できます。しかし、最も一般的な方法はローカルファイルシステムに保存されたファイルから RDD を作成することです。この方法では、ファイルパスを受け取り、そのファイルを行の集合として読み込みます。この演習では、ワークスペースにすでに用意されているファイル名 README.md のファイルパス(file_path)から RDD を作成します。
ワークスペースにはすでに SparkContext sc が用意されていることを思い出してください。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- PySpark シェルで
file_pathを表示してください。 file_pathからfileRDDという名前の RDD を作成してください。- 作成した
fileRDDの型を表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))