Začněte nyníZačněte zdarma

RegEx v Pythonu

Extrakce informací na základě pravidel se hodí pro mnoho NLP úloh. Určité typy entit, jako jsou data nebo telefonní čísla, mají jasně daný formát, který lze rozpoznat pomocí sady pravidel – bez nutnosti trénovat jakýkoli model. V tomto cvičení si procvičíš práci s balíčkem re pro regulární výrazy. Cílem je najít telefonní čísla v daném textu text.

Balíček re je již naimportován. Pomocí \d můžeš porovnávat vzory řetězců odpovídající metaznaku, který odpovídá libovolné číslici od 0 do 9.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Definuj vzor pro vyhledávání telefonních čísel ve formátu (111)-111-1111.
  • Najdi všechny odpovídající vzory pomocí metody re.finditer().
  • Pro každou shodu vypiš počáteční a koncový znak a odpovídající část daného textu text.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

text = "Our phone number is (425)-123-4567."

# Define a pattern to match phone numbers
pattern = r"\((____){____}\)-(____){____}-(____){____}"

# Find all the matching patterns in the text
phones = re.____(pattern, text)

# Print start and end characters and matching section of the text
for match in phones:
    start_char = match.____
    end_char = match.____
    print("Start character: ", ____, "| End character: ", ____, "| Matching text: ", text[____:____])
Upravit a spustit kód