あなたと同僚が Global Retail Analytics でそれぞれ customer_orders.csv を読み込み、同じクリーニングパイプラインを実行しましたが、結果が異なりました。画像には両方のアプローチが並べて示されています。
customer_orders.csv
行数に差異が生じた最も可能性の高い原因は何でしょうか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、Databricks ノートブックの操作方法、CSV データを Spark DataFrame に読み込む方法、PySpark と SQL を使ったデータ整形の方法を学びます。
明示的なスキーマの定義、データクリーニングパイプラインの構築、ブロードキャストジョインによるクエリパフォーマンスの最適化について学びます。
現在の演習
ウィンドウ関数を使った累計値とランキングの計算、ストリーミングパイプラインの構築、そして本番ワークフローのデプロイ方法を学びます。