RegEx w Pythonie
Ekstrakcja informacji oparta na regułach przydaje się w wielu zadaniach NLP. Niektóre typy encji – na przykład daty czy numery telefonów – mają charakterystyczny format, który można rozpoznać za pomocą zestawu reguł, bez konieczności trenowania jakiegokolwiek modelu. W tym ćwiczeniu przećwiczysz korzystanie z pakietu re do obsługi wyrażeń regularnych (RegEx). Celem jest znalezienie numerów telefonów w podanym text.
Pakiet re jest już zaimportowany. Możesz użyć \d do dopasowywania wzorców reprezentujących metaznak pasujący do dowolnej cyfry od 0 do 9.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Zdefiniuj wzorzec dopasowujący numery telefonów w formacie (111)-111-1111.
- Znajdź wszystkie pasujące wzorce, używając metody
re.finditer(). - Dla każdego dopasowania wypisz pozycję początkową i końcową oraz odpowiadający fragment podanego
text.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
text = "Our phone number is (425)-123-4567."
# Define a pattern to match phone numbers
pattern = r"\((____){____}\)-(____){____}-(____){____}"
# Find all the matching patterns in the text
phones = re.____(pattern, text)
# Print start and end characters and matching section of the text
for match in phones:
start_char = match.____
end_char = match.____
print("Start character: ", ____, "| End character: ", ____, "| Matching text: ", text[____:____])