PySpark シェルでのデータ読み込み
PySpark では、クラスター全体で自動的に並列化される分散コレクションに対する操作として計算を表現します。前の演習では、リストを並列化コレクションとして読み込む例を見ました。この演習では、PySpark シェルでローカルファイルからデータを読み込みます。
作業環境には、すでに SparkContext の sc と、README.md へのパスである file_path 変数が用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- ローカルのテキストファイル
README.mdを PySpark シェルで読み込みます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load a local file into PySpark shell
lines = sc.____(file_path)