Zacznij terazZacznij za darmo

Dopasowywanie wszystkich grup przechwytujących

W tym ćwiczeniu będziesz pracować z plikiem tekstowym top_10, który przechowuje tytuły filmów i ich pozycje rankingowe. W tym wielowierszowym tekście \\n oznacza przejście do nowego wiersza. Użyjesz funkcji str_split(), aby podzielić plik tekstowy na osobne wiersze.

Utworzony w ten sposób jednoierszowy macierz top_10_lines zawiera dziesięć linii o tym samym wzorcu: pozycja rankingowa filmu, po której następuje kropka i spacja, a dalej sam tytuł. Funkcja str_match() oraz dwie grupy przechwytujące () umożliwią wyodrębnienie tych dwóch informacji z surowego tekstu i zapisanie ich w formie tabelarycznej.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w R – poziom średnio zaawansowany

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji str_split(), aby podzielić tekst na wiersze – włącz argument simplify, żeby otrzymać macierz znakową.
  • Zapoznaj się ze strukturą wiersza. Zawiera on pozycję rankingową oraz tytuł filmu.
  • Wyodrębnij pozycję rankingową i tytuł filmu, używając grup przechwytujących w funkcji str_match().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split the input by line break and enable simplify
top_10_lines <- str_split(
  top_10,
  pattern = "___",
  simplify = ___
)

# Inspect the first three lines and analyze their form
___[1:3]

# Add to the pattern two capturing groups that match rank and title
str_match(
  top_10_lines,
  pattern = "___\\. ___"
)
Edytuj i uruchom kod