始める無料で始める

外部データセットからの RDD

PySpark は、HDFS(Hadoop Distributed File System)や Amazon S3 バケットなどの外部ストレージに保存されたファイルから、簡単に RDD を作成できます。しかし、最も一般的な方法はローカルファイルシステムに保存されたファイルから RDD を作成することです。この方法では、ファイルパスを受け取り、そのファイルを行の集合として読み込みます。この演習では、ワークスペースにすでに用意されているファイル名 README.md のファイルパス(file_path)から RDD を作成します。

ワークスペースにはすでに SparkContext sc が用意されていることを思い出してください。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • PySpark シェルで file_path を表示してください。
  • file_path から fileRDD という名前の RDD を作成してください。
  • 作成した fileRDD の型を表示してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
コードを編集して実行