Zachycení všech skupin
V tomto cvičení budeš pracovat s textovým souborem top_10, který obsahuje názvy filmů a jejich pořadí. V tomto víceřádkovém textu se \\n používá k odřádkování. Pomocí funkce str_split() rozdělíš textový soubor na jednotlivé řádky.
Nově vytvořená jednořádková matice top_10_lines pak obsahuje deset řádků se stejným vzorem: pořadí filmu následované tečkou a mezerou a samotný název filmu. Funkce str_match() spolu se dvěma zachytávacími skupinami () ti umožní extrahovat tyto dvě informace z prostého textu do přehledné tabulkové podoby.
Toto cvičení je součástí kurzu
Intermediate Regular Expressions in R
Pokyny k cvičení
- Pomocí funkce
str_split()rozděl text na jednotlivé řádky a výstup vrať jako znakovou matici – to zajistíš zapnutím parametrusimplify. - Prohlédni si strukturu jednoho řádku. Obsahuje pořadí a název filmu.
- Extrahuj pořadí a název filmu pomocí zachytávacích skupin ve funkci
str_match().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the input by line break and enable simplify
top_10_lines <- str_split(
top_10,
pattern = "___",
simplify = ___
)
# Inspect the first three lines and analyze their form
___[1:3]
# Add to the pattern two capturing groups that match rank and title
str_match(
top_10_lines,
pattern = "___\\. ___"
)