データパイプラインを構築する主な目的は、データの取り込みから最終的な利用者に届くまでの流れを、より効率的にすることです。
以下の選択肢のほとんどは正しいですが、1つだけ誤っています。どれでしょうか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、データエンジニアリングとは何か、そしてデータエンジニアの需要がなぜ高まっているのかを学びます。 続いて、データサイエンスのプロセス全体の中で、データエンジニアリングがどの部分を担うのかを見ていきます。また、データエンジニアとデータサイエンティストの違いを学び、データパイプラインの全体像にも触れます。
現在の演習
ここからは、データエンジニアの主な仕事の一つである、データの保存について見ていきましょう。 この章では、データエンジニアがさまざまな構造のデータを管理する方法や、データのクエリや保存に広く使われているプログラミング言語、SQLの扱い方を学びます。さらに、データレイクやデータウェアハウスを活用して、用途に適したデータ保存の仕組みを構築する方法についても見ていきます。
データエンジニアは、各段階でさまざまな処理手法を使って生データを分析しやすい形に整え、データサイエンティストの仕事を支えます。 こうしたステップを組み合わせてパイプラインを構築するうえで、自動化が重要になります。 最後に、データエンジニアは、パイプラインを安定して稼働させるために、並列コンピューティングやクラウドコンピューティングを活用します。