Dopasowywanie wszystkich grup przechwytujących
W tym ćwiczeniu będziesz pracować z plikiem tekstowym top_10, który przechowuje tytuły filmów i ich pozycje rankingowe. W tym wielowierszowym tekście \\n oznacza przejście do nowego wiersza. Użyjesz funkcji str_split(), aby podzielić plik tekstowy na osobne wiersze.
Utworzony w ten sposób jednoierszowy macierz top_10_lines zawiera dziesięć linii o tym samym wzorcu: pozycja rankingowa filmu, po której następuje kropka i spacja, a dalej sam tytuł. Funkcja str_match() oraz dwie grupy przechwytujące () umożliwią wyodrębnienie tych dwóch informacji z surowego tekstu i zapisanie ich w formie tabelarycznej.
To ćwiczenie jest częścią kursu
Wyrażenia regularne w R – poziom średnio zaawansowany
Instrukcje do ćwiczenia
- Użyj funkcji
str_split(), aby podzielić tekst na wiersze – włącz argumentsimplify, żeby otrzymać macierz znakową. - Zapoznaj się ze strukturą wiersza. Zawiera on pozycję rankingową oraz tytuł filmu.
- Wyodrębnij pozycję rankingową i tytuł filmu, używając grup przechwytujących w funkcji
str_match().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the input by line break and enable simplify
top_10_lines <- str_split(
top_10,
pattern = "___",
simplify = ___
)
# Inspect the first three lines and analyze their form
___[1:3]
# Add to the pattern two capturing groups that match rank and title
str_match(
top_10_lines,
pattern = "___\\. ___"
)