並列化したコレクションからのRDD作成
Resilient Distributed Dataset(RDD)は、Spark における基本的な抽象化です。RDD はオブジェクトの不変な分散コレクションです。RDD は Spark の基盤となるデータ型なので、その作り方を理解しておくことが重要です。この演習では、単語のコレクションから PySpark で最初の RDD を作成します。
作業環境にはすでに SparkContext の sc が用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- 単語のPython リストから
RDDという名前の RDD を作成します。 - 作成したオブジェクトが RDD であることを確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))