Bắt đầu ngayBắt đầu miễn phí

Thử tên khác

Bạn vẫn đang làm phân tích cảm xúc trên Twitter. Giờ bạn xem xét một số điều đáng chú ý: bạn nhận ra có các địa chỉ email được chèn trong một số tweet. Bạn tò mò muốn biết tên nào xuất hiện nhiều nhất.

Bạn muốn trích xuất phần đầu của email. Ví dụ, nếu có email [email protected], bạn chỉ quan tâm đến marysmith90. Bạn cần khớp toàn bộ biểu thức, để đảm bảo chỉ trích xuất các tên có mặt trong email. Ngoài ra, bạn chỉ quan tâm các tên chứa chữ cái hoa (ví dụ A, B, Z), chữ cái thường (ví dụ a, d, z) và số.

Danh sách sentiment_analysis chứa văn bản của ba tweet cũng như mô-đun re đã được nạp trong phiên làm việc của bạn. Bạn có thể dùng print() để xem chúng trong IPython Shell.

Bài tập này là một phần của khóa học

Regular Expressions in Python

Xem khóa học

Hướng dẫn bài tập

  • Hoàn thiện regex để khớp email và chỉ bắt phần tên. Phần tên xuất hiện trước dấu @.
  • Tìm tất cả kết quả khớp của regex trong mỗi phần tử của sentiment_analysis. Gán vào biến email_matched.
  • Hoàn thiện phương thức .format() để in ra các kết quả bắt được trong mỗi phần tử của sentiment_analysis.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Write a regex that matches email
regex_email = r"___[____]____\S+"

for tweet in sentiment_analysis:
    # Find all matches of regex in each tweet
    email_matched = re.____(____, ____)

    # Complete the format method to print the results
    print("Lists of users found in this tweet: {}".format(____))
Chỉnh sửa và Chạy Mã