or
Toto cvičení je součástí kurzu
Regulární výrazy mohou zpočátku působit trochu děsivě – obsahují spoustu speciálních znaků. V této kapitole se naučíš je rozluštit a psát vlastní vzory, které najdou přesně to, co hledáš.
Aktuální cvičení
V této kapitole se na chvíli odložíme regulární výrazy stranou a zaměříme se na práci s řetězci – budeme je vytvářet z jiných datových struktur, jako jsou vektory nebo seznamy.
Regulární výrazy opravdu zazáří při zpracování neuspořádaného textu. V této kapitole se naučíš extrahovat informace z dat, která nepřicházejí v přehledných tabulkách, ale v prostém textu.
V poslední kapitole opustíme regulární výrazy a zaměříme se na vzdálenosti řetězců. Výpočtem rozdílů mezi řetězci dokážeme spárovat ty, které si jsou podobné – a najít tak duplicity i tehdy, když obsahují drobné chyby jako překlepy. Právě to je klíčová součást record linkage, kde kombinujeme datasety z různých zdrojů.