or
Den här övningen är en del av kursen
Det här kapitlet ger en grundlig introduktion till Data Version Control (DVC), ett verktyg som är centralt för dataversionshantering inom maskininlärning. Du utforskar motivationen bakom dataversionshantering, förstår skillnaderna jämfört med kodversionshantering och experimenterar med ett enkelt klassificeringsproblem. Du repeterar grundläggande Git-kommandon, lär dig om DVC och övar på att sätta upp ett repository. Kapitlet avslutas med en översikt av DVC:s funktioner och användningsområden, däribland versionshantering av data och modeller, CI/CD för maskininlärning, experimentspårning, pipelines och mer därtill.
Det här kapitlet går på djupet med konfigurationen av DVC och täcker installation, initiering av repository och användning av filen .dvcignore. Du utforskar DVC-cachen och hur filer mellanlagras, och lär dig lägga till och ta bort filer, hantera cachen samt förstå de underliggande mekanismerna med hjälp av MD5-hash. Kapitlet förklarar också DVC-fjärrkällor, hur de skiljer sig från Git-fjärrkällor, och visar hur du lägger till, listar och ändrar dem. Avslutningsvis lär du dig interagera med fjärrkällorna genom att pusha och hämta data, checka ut specifika versioner och hämta data till cachen.
Det här kapitlet fokuserar på att automatisera ML-pipelines med DVC. Du skapar en konfigurationsfil med inställningar och hyperparametrar, och lär dig visualisera pipelines med hjälp av riktade acykliska grafer samt använda kommandon för att beskriva beroenden, kommandon och utdata. Du lär dig också köra DVC-pipelines, inklusive lokal modellträning och hur Git spårar DVC-metadata. Dessutom utforskar du spårning av mätvärden och diagram i DVC – hur du skriver ut mätvärden, skapar diagramfiler och jämför mätvärden och diagram mellan olika steg i pipelinen.
Aktuell övning