データサイエンスチームとランチをしていると、新しいデータエンジニアのインターン、サーシャがこんなことを話してきました。「並列コンピューティングは万能ツールで、どんなタスクにもいつでも使えます。あらゆるデータ処理タスクを最適化してくれるので、パイプライン全体に導入すべきです。私も喜んで手伝います!」
彼女の発言は正しいでしょうか、それとも誤りでしょうか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、データエンジニアリングとは何か、そしてその需要がなぜ高まっているのかを学びます。 次に、データエンジニアリングがデータサイエンスのライフサイクルの中でどの位置にあるのか、データエンジニアがデータサイエンティストとどのように異なるのかを学び、最初の完全なデータパイプラインについて紹介します。
データエンジニアの主な責任の一つであるデータストレージについて話しましょう。 この章では、データエンジニアがさまざまなデータ構造をどのように管理し、データのクエリや保存に選ばれるプログラミング言語であるSQLで作業し、データレイクやデータウェアハウスを用いた適切なデータストレージソリューションを実装する方法について学びます。
データエンジニアは、さまざまな処理手法を用いて生データを分析用に準備することで、データサイエンティストの作業を容易にします。 これらのステップを組み合わせてパイプラインを作成する必要があり、その際に自動化が活用されます。 最後に、データエンジニアはパイプラインを円滑に流し続けるために、並列コンピューティングやクラウドコンピューティングを活用します。
現在の演習