or
Toto cvičení je součástí kurzu
První kapitola kurzu Úvod do zpracování přirozeného jazyka tě připraví na první analýzu textu. Prozkoumáš regulární výrazy a tokenizaci – dva z nejběžnějších stavebních kamenů většiny analytických úloh. Regulární výrazy ti umožní vyhledávat libovolné vzory a tokenizace ti pomůže připravit a vyčistit text pro sofistikovanější analýzu. Tato kapitola je nezbytným základem pro techniky, které se naučíš v dalších kapitolách kurzu.
Aktuální cvičení
V této kapitole se seznámíš s nejrozšířenějšími a nejprobádanějšími přístupy k analýze textu. Naučíš se vytvořit textový korpus, rozšířit reprezentaci bag-of-words na matici TFIDF a pomocí metriky kosinové podobnosti zjistit, jak jsou si dva texty navzájem blízké. Upevníš si základy NLP a připravíš se na jeho praktické aplikace ve 3. a 4. kapitole.
Třetí kapitola se zaměřuje na dva běžné přístupy k analýze textu: klasifikační modelování a tematické modelování. Pokud pracuješ na projektech zaměřených na analýzu textu, dříve nebo později využiješ jednu z těchto metod, nebo obě. Kapitola tě naučí, jak obě techniky provádět, a přiblíží ti, jak k nim přistupovat v praxi.
Ve čtvrté kapitole se věnujeme dvěma pilířům zpracování přirozeného jazyka: analýze sentimentu a word embeddings. Jde o techniky, které by neměl přeskočit nikdo, kdo se učí základy analýzy textu. Navíc se stručně seznámíš s BERT, tagováním slovních druhů a rozpoznáváním pojmenovaných entit. Celý kurz pokrývá téměř 15 různých analytických technik, a proto čtvrtá kapitola završí vše přehledným shrnutím toho, co ses v kurzu naučil/a.