データサイエンティストは、データを分析するだけでなく、統計と機械学習を使って隠れたパターンを発見し、未来を予測します。 主な使用ツールはPythonとRです。不正検知、トレンド予測、Netflixのレコメンド改善など、複雑なデータをもとに、より良い判断を実現します。
データサイエンティストの主な役割として最も適切なものはどれですか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
まず、データサイエンスとは何かを定義することから始めましょう。データサイエンスのワークフローと、現実世界への応用方法を学びます。章の最後では、データサイエンス分野におけるさまざまな職種についても取り上げます。
現在の演習
データサイエンスのワークフローを理解したところで、最初のステップである「データの収集と保存」を詳しく見ていきましょう。データの収集源、データの形式、収集後の保存方法、そしてデータパイプラインによるプロセスの自動化について学びます。
データの前処理は、データサイエンスの根幹をなす工程です。データサイエンティストは業務時間の80%をデータのクレンジングや加工に費やし、実際の分析に充てる時間はわずか20%と言われています。この章では、データの問題を特定する方法や、欠損値・外れ値への対処法を学びます。さらに、データを探索し、分析結果を伝えるための視覚化についても学びましょう。
最終章では、実験・検証と予測について学びます。まず実験の手法としてA/Bテストを取り上げ、次に時系列予測で将来の出来事を予測する方法を学びます。最後に機械学習の、教師あり学習とクラスタリングを紹介します。