or
Acest exercițiu face parte din cursul
Capitolul 1 al cursului Introducere în Prelucrarea Limbajului Natural te pregătește să rulezi prima ta analiză pe text. Vei explora expresiile regulate și tokenizarea – două dintre cele mai frecvente componente ale majorității sarcinilor de analiză. Cu expresii regulate poți căuta orice tipar îți imaginezi, iar cu tokenizarea poți pregăti și curăța textul pentru analize mai sofisticate. Acest capitol este esențial pentru a aborda tehnicile pe care le vei învăța în capitolele următoare.
Exercițiul curent
În acest capitol, vei învăța cele mai comune și studiate metode de analiză a textului. Vei vedea cum se creează un corpus de text, cum se extinde o reprezentare bag-of-words într-o matrice TFIDF și cum se folosesc metrici de similaritate cosinus pentru a determina cât de asemănătoare sunt două texte. Îți consolidezi astfel bazele pentru practicarea NLP, înainte de a trece la aplicații în capitolele 3 și 4.
Capitolul 3 se concentrează pe două abordări frecvente în analiza textului: modelarea pentru clasificare și modelarea tematică. Dacă lucrezi la proiecte de analiză a textului, vei folosi cu siguranță una sau ambele metode. Acest capitol te învață cum să aplici ambele tehnici și îți oferă perspective practice despre cum să le abordezi eficient.
În capitolul 4 acoperim două tehnici de bază din prelucrarea limbajului natural: analiza sentimentelor și reprezentările vectoriale ale cuvintelor (word embeddings). Acestea sunt tehnici esențiale pentru oricine învață fundamentele analizei textului. În plus, vei face o scurtă incursiune în BERT, etichetarea morfosintactică și recunoașterea entităților denumite. Deoarece în acest curs sunt acoperite aproape 15 tehnici de analiză diferite, capitolul 4 se încheie cu o recapitulare a tuturor metodelor pe care le-ai învățat.