or
Den här övningen är en del av kursen
Kapitel 1 i Introduktion till naturlig språkbehandling förbereder dig för att köra din första analys på text. Du utforskar reguljära uttryck och tokenisering – två av de vanligaste komponenterna i de flesta analysuppgifter. Med reguljära uttryck kan du söka efter vilket mönster som helst, och med tokenisering kan du förbereda och rensa text inför mer avancerad analys. Det här kapitlet är en nödvändig grund för de tekniker vi går igenom i kursens återstående kapitel.
I det här kapitlet lär du dig de vanligaste och mest studerade metoderna för att analysera text. Du tittar på hur man skapar ett textkorpus, bygger ut en bag-of-words-representation till en TFIDF-matris och använder cosinuslikhetsmetrik för att avgöra hur lika två texter är varandra. Du bygger vidare på dina grunder i NLP innan du dyker in i tillämpningar i kapitel 3 och 4.
Kapitel 3 fokuserar på två vanliga metoder för textanalys: klassificeringsmodellering och ämnesmodellering. Om du arbetar med textanalysprojekt kommer du förr eller senare att använda en eller båda av dessa metoder. Det här kapitlet lär dig hur du genomför båda teknikerna och ger insikt i hur du kan angripa dem på ett praktiskt sätt.
I kapitel 4 tar vi upp två grundpelare inom naturlig språkbehandling: sentimentanalys och ordembeddingar. Det här är två analystekniker som är oumbärliga för alla som lär sig grunderna i textanalys. Du får även en kort introduktion till BERT, ordklasstaggning och namngiven enhetsigenkänning. Kursen täcker sammanlagt nästan 15 olika analystekniker, och kapitel 4 avslutas med en sammanfattning av alla de tekniker du har lärt dig under kursens gång.
Aktuell övning