Začněte nyníZačněte zdarma

Zachycení všech skupin

V tomto cvičení budeš pracovat s textovým souborem top_10, který obsahuje názvy filmů a jejich pořadí. V tomto víceřádkovém textu se \\n používá k odřádkování. Pomocí funkce str_split() rozdělíš textový soubor na jednotlivé řádky.

Nově vytvořená jednořádková matice top_10_lines pak obsahuje deset řádků se stejným vzorem: pořadí filmu následované tečkou a mezerou a samotný název filmu. Funkce str_match() spolu se dvěma zachytávacími skupinami () ti umožní extrahovat tyto dvě informace z prostého textu do přehledné tabulkové podoby.

Toto cvičení je součástí kurzu

Intermediate Regular Expressions in R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí funkce str_split() rozděl text na jednotlivé řádky a výstup vrať jako znakovou matici – to zajistíš zapnutím parametru simplify.
  • Prohlédni si strukturu jednoho řádku. Obsahuje pořadí a název filmu.
  • Extrahuj pořadí a název filmu pomocí zachytávacích skupin ve funkci str_match().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the input by line break and enable simplify
top_10_lines <- str_split(
  top_10,
  pattern = "___",
  simplify = ___
)

# Inspect the first three lines and analyze their form
___[1:3]

# Add to the pattern two capturing groups that match rank and title
str_match(
  top_10_lines,
  pattern = "___\\. ___"
)
Upravit a spustit kód