or
この演習はコースの一部です
この章では、Spark で SQL テーブルを作成してクエリを実行する方法を学びます。Spark SQL は SQL の表現力を Spark にもたらします。また、Spark における SQL のウィンドウ関数の使い方も学びます。ウィンドウ関数は、現在行に関連する複数行にまたがって計算を行います。これにより、結合や従来の集計だけでは表現が難しい処理を大幅に簡単にできます。基本的な SQL では難しいランニングサム、ランニング差分、その他の操作をウィンドウ関数で実行していきます。
この章では、自然言語のテキストを読み込み、移動ウィンドウ分析を適用して頻出する単語列を見つけます。
前の章では、ウィンドウ関数 SQL の表現力を活用する方法を学びました。一方で、この表現力を活かすには、DataFrame や SQL テーブルを適切にキャッシュする方法を理解することが重要です。アプリケーションを評価する方法を知ることも欠かせません。ここでは Spark UI を使ってそれを行う方法を学びます。さらに、Spark におけるロギングのベストプラクティスも紹介します。Spark SQL には、クエリのパフォーマンスチューニングに役立つもう一つの便利なツールであるクエリ実行プランもあります。実行プランを使って DataFrame の由来を評価する方法を学びます。
これまでの章では、生のテキストを読み込み、トークン化し、単語列を抽出するためのツールを学びました。これは分析としても有用ですが、Machine Learning にも役立ちます。ここまでに学んだ内容を組み合わせ、ロジスティック回帰でテキストを分類します。章の終わりまでに、生の自然言語テキストデータを読み込み、それを使ってテキスト分類器を学習させます。
現在の演習