DVC 파이프라인에서 YAML 파일에 의존성, 결과물, 명령을 정의하는 주된 목적은 무엇인가요?
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
이 장에서는 Machine Learning에서 데이터 버저닝을 위해 필수적인 도구인 Data Version Control(DVC)을 폭넓게 소개합니다. 데이터 버저닝의 필요성을 살펴보고, 코드 버전 관리와의 차이를 이해하며, 간단한 분류 문제로 실습해 봅니다. 기본 Git 명령을 복습한 뒤 DVC를 배우고, 저장소를 설정하는 과정을 연습합니다. 마지막으로 데이터와 모델의 버전 관리, ML을 위한 CI/CD, 실험 추적, 파이프라인 등 DVC의 주요 기능과 활용 사례를 개괄합니다.
현재 연습
이 장에서는 DVC의 설치, 저장소 초기화, 그리고 .dvcignore 파일 사용 등 환경 설정을 다룹니다. 이어서 DVC 캐시와 스테이징 파일을 탐색하며, 파일 추가/삭제, 캐시 관리, 그리고 MD5 해시를 통해 동작 원리를 이해하는 방법을 배웁니다. 또한 Git 리모트와 구분되는 DVC 리모트를 설명하고, 리모트를 추가, 목록 조회, 수정하는 방법을 안내합니다. 마지막으로 리모트와 상호작용하는 방법으로 데이터 push/pull, 특정 버전 checkout, 캐시로 데이터 fetch하는 절차를 학습합니다.
이 장은 DVC로 ML 파이프라인을 자동화하는 데 초점을 맞춥니다. 설정과 하이퍼파라미터를 담은 구성 파일을 만들고, 유향 비순환 그래프를 사용한 파이프라인 시각화를 학습합니다. 의존성, 명령, 결과물을 기술하는 명령어도 사용합니다. DVC 파이프라인 실행, 로컬 모델 학습, 그리고 Git이 DVC 메타데이터를 추적하는 방식도 다룹니다. 추가로 DVC에서의 지표와 플롯 추적을 살펴보며, 지표 출력, 플롯 파일 생성, 파이프라인 단계 간 지표와 플롯 비교 방법을 배웁니다.