or
Den här övningen är en del av kursen
Lär dig beräkna grundläggande särdrag som antal ord, antal tecken, genomsnittlig ordlängd och antal specialtecken (till exempel Twitter-hashtaggar och omnämnanden). Du lär dig också att beräkna läsbarhetspoäng och avgöra hur mycket utbildning som krävs för att förstå en text.
I det här kapitlet lär du dig om tokenisering och lemmatisering. Du lär dig sedan att utföra textrensning, ordklasstaggning och namngiven enhetsigenkänning med biblioteket spaCy. När du behärskar dessa koncept går du vidare och gör Gettysburgtalets text maskinvänlig, analyserar substantivanvändning i falska nyheter och identifierar personer som nämns i en artikel från TechCrunch.
Lär dig om n-gram-modellering och använd det för att utföra sentimentanalys på filmrecensioner.
Lär dig beräkna tf-idf-vikter och kosinuslikhet mellan två vektorer. Du använder dessa koncept för att bygga ett rekommendationssystem för filmer och ett för TED Talks. Avslutningsvis lär du dig om ordinbäddningar och använder ordvektorer för att beräkna likheter mellan olika låtar av Pink Floyd.
Aktuell övning