次のうち、Big Data の3つのVのうちに含まれないものはどれですか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、Big Dataの魅力的な世界を紹介し、Big Data処理のためのさまざまな概念とフレームワークについて学びます。なぜApache SparkがBig Dataに最適なフレームワークと考えられているのかを理解できます。
現在の演習
Sparkが提供する主な抽象化はresilient distributed dataset(RDD)であり、これはこのエンジンの基盤となる基本データ型です。本章ではRDDを紹介し、RDD TransformationsやActionsを使ってRDDを作成・実行する方法を学びます。
この章では、構造化データ処理のためのSparkモジュールであるSpark SQLについて学びます。DataFrameというプログラミング抽象化を提供し、分散SQLクエリエンジンとしても動作します。本章では、Spark SQLを使ってPythonでDataFrameを扱う方法を示します。
PySpark MLlibは、Pythonで利用できるApache SparkのスケーラブルなMachine Learningライブラリで、一般的な学習アルゴリズムやユーティリティを含みます。最終章を通して、重要なMachine Learningアルゴリズムを学びます。映画のレコメンデーションエンジンやスパムフィルタを構築し、k-meansクラスタリングも実装します。