or
Den här övningen är en del av kursen
I det här kapitlet repeterar du grunderna i ett övervakat inlärningsflöde, med modellträning, finjustering och urval, särdragsframtagning och -urval samt tekniker för att dela upp data. Du lär dig hur dessa steg i ett flöde beror av varandra och hur de alla kan bidra till – eller motverka – överanpassning: datavetarens värsta fiende. När kapitlet är slut behärskar du övervakad inlärning och är redo att ta dig an det mer avancerade materialet i kommande kapitel.
I föregående kapitel fördjupade du dina kunskaper om standardflöden för övervakad inlärning. I det här kapitlet granskar du kritiskt hur expertkunskap integreras i övervakad inlärning. Det sker genom att identifiera rätt analysenhet – vilket kan kräva särdragsframtagning från flera datakällor – genom den ibland ofullkomliga processen att märka exempel, samt genom att specificera en förlustfunktion som fångar det verkliga affärsvärdet av de fel din maskininlärningsmodell gör.
Aktuell övning
I föregående kapitel använde du olika sätt att integrera expertåterkoppling i ditt flöde och utvärdera det utifrån affärsvärde. Nu är det dags att öva på de färdigheter som krävs för att produktionssätta din modell och säkerställa att den fortsätter prestera väl – genom att iterativt förbättra den. Du lär dig också att diagnostisera datamängdsförskjutning och minska den effekt som en föränderlig miljö kan ha på modellens träffsäkerhet.
I de tidigare kapitlen lade du en solid grund inom övervakad inlärning, inklusive kunskaper om att driftsätta modeller i produktion – men alltid med antagandet att en märkt datamängd skulle finnas tillgänglig. I det här kapitlet tar du dig an utmaningen att modellera data utan, eller med mycket få, etiketter. Det leder dig in i anomalidetektion, en form av oövervakad modellering, samt distansbaserad inlärning, där antaganden om likhet mellan exempel kan ersätta etiketter och hjälpa dig nå en träffsäkerhet som är jämförbar med ett övervakat flöde. När du har genomfört kapitlet sticker du tydligt ut bland datavetenskap och vet med säkerhet vilka verktyg du ska använda för att anpassa ditt flöde och hantera vanliga verkliga utmaningar.