DVC パイプラインは Machine Learning のワークフローを効率化し、データとコードのバージョン管理、トラッキング、キャッシングを可能にします。パイプラインの実行方法を理解すると、効果的なワークフローを設計できます。この演習では、DVC が再現可能なパイプラインをどのように実行するかを確認します。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、Machine Learningにおけるデータのバージョン管理に不可欠なツール、Data Version Control (DVC) を包括的に紹介します。なぜデータのバージョン管理が必要なのか、その動機を探り、コードのバージョン管理との違いを理解したうえで、シンプルな分類問題に取り組みます。基本的なGitコマンドを復習し、DVCの基礎を学び、リポジトリのセットアップを実践します。章の終わりには、データやモデルのバージョニング、Machine LearningのCI/CD、実験管理、パイプラインなど、DVCの機能とユースケースの全体像を確認します。
この章では、DVCのセットアップを詳しく扱います。インストール、リポジトリの初期化、.dvcignoreファイルの活用までをカバーします。さらに、DVCのキャッシュとステージングファイルを理解し、ファイルの追加・削除、キャッシュの管理、MD5ハッシュを用いた内部仕組みを学びます。加えて、Gitのリモートと区別しながらDVCリモートについて解説し、追加・一覧表示・変更の方法をガイドします。最後に、データのプッシュ/プル、特定バージョンのチェックアウト、キャッシュへのフェッチなど、リモートとのやり取りの手順を学びます。
この章では、DVCを使ってMLパイプラインを自動化する方法に焦点を当てます。設定やハイパーパラメータを含む構成ファイルを作成し、有向非巡回グラフによるパイプラインの可視化を学びます。依存関係、コマンド、出力を記述するためのコマンドも扱います。DVCパイプラインの実行、ローカルでのモデル学習、GitがDVCメタデータをどのように追跡するかを取り上げます。さらに、DVCでのメトリクスとプロットのトラッキングについて、メトリクスの表示、プロットファイルの作成、パイプラインの各ステージ間でのメトリクスやプロットの比較方法を学びます。
現在の演習