Matcha alla infångningsgrupper
I den här övningen arbetar du med en textfil som heter top_10 och som innehåller filmnamn och deras rankning. I den flersidiga texten används \\n för att starta en ny rad. Du använder funktionen str_split() för att dela upp textfilen i flera rader.
Den nyskapade matrisen med en rad, top_10_lines, innehåller sedan tio rader med samma mönster: filmens rankning följt av en punkt och ett mellanslag och sedan filmtiteln. Funktionen str_match() och två infångningsgrupper () gör det möjligt att extrahera dessa två informationsdelar från vanlig text till ett tabellformat.
Den här övningen är en del av kursen
Reguljära uttryck på mellannivå i R
Övningsinstruktioner
- Använd funktionen
str_split()för att dela upp texten i rader och returnera en teckensträmatrisen genom att aktiverasimplify. - Bekanta dig med strukturen hos en rad. Den innehåller rankningen och titeln på en film.
- Extrahera rankningen och titeln på en film med hjälp av infångningsgrupper i funktionen
str_match().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Split the input by line break and enable simplify
top_10_lines <- str_split(
top_10,
pattern = "___",
simplify = ___
)
# Inspect the first three lines and analyze their form
___[1:3]
# Add to the pattern two capturing groups that match rank and title
str_match(
top_10_lines,
pattern = "___\\. ___"
)