データにはさまざまな構造があることを学びましたね。構造化データ、半構造化データ、非構造化データを正しく定義できますか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
このチャプターでは、データエンジニアリングとは何か、そしてその需要がなぜ高まっているのかを学びます。次に、データエンジニアリングがデータサイエンスのライフサイクルの中でどの位置にあるのか、データエンジニアとデータサイエンティストの違い、そして最初の完全なデータパイプラインの概要について学びます。
データエンジニアの主な責務のひとつであるデータストレージについて見ていきましょう。この章では、データエンジニアがさまざまなデータ構造をどのように管理するか、クエリとデータ保存に広く使われるプログラミング言語であるSQLの活用方法、そしてデータレイクやデータウェアハウスを用いた適切なデータストレージソリューションの実装方法を学んでいきましょう。
現在の演習
データエンジニアは、さまざまな処理技術をデータパイプラインの各ステップで活用し、分析用に生データを整えることで、データサイエンティストの作業を容易にします。これらのステップは組み合わせてパイプラインとして構築する必要があり、ここで自動化が重要になります。さらに、データエンジニアはパイプラインを安定して稼働させるために、並列処理やクラウドコンピューティングを活用します。