Potrivirea tuturor grupurilor de captare
În acest exercițiu, vei lucra cu un fișier text numit top_10, care stochează numele filmelor și rangul lor. În acest text pe mai multe linii, \\n este folosit pentru a începe o linie nouă. Vei folosi funcția str_split() pentru a împărți fișierul text în mai multe linii.
Matricea nou creată cu un singur rând, top_10_lines, conține zece linii cu același tipar: rangul filmului, urmat de un punct și un spațiu, apoi titlul filmului. Funcția str_match() și două grupuri de captare () îți vor permite să extragi aceste două informații din text simplu într-un format tabelar.
Acest exercițiu face parte din cursul
Expresii regulate intermediare în R
Instrucțiuni pentru exercițiu
- Folosește funcția
str_split()pentru a împărți textul în liniile sale, obținând o matrice de caractere prin activarea argumentuluisimplify. - Familiarizează-te cu structura unei linii. Aceasta conține rangul și titlul unui film.
- Extrage rangul și titlul unui film folosind grupuri de captare în funcția
str_match().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split the input by line break and enable simplify
top_10_lines <- str_split(
top_10,
pattern = "___",
simplify = ___
)
# Inspect the first three lines and analyze their form
___[1:3]
# Add to the pattern two capturing groups that match rank and title
str_match(
top_10_lines,
pattern = "___\\. ___"
)