Bắt đầu ngayBắt đầu miễn phí

Quay lại văn phòng

Bạn vẫn đang làm nhà phân tích dữ liệu cho một công ty web và được giao nhiệm vụ web scraping. Bạn nhận được một danh sách URL cần phân tích — công việc bạn đã bắt đầu ở chương trước.

Bạn dự đoán đây sẽ là tác vụ lặp lại: chắc chắn vài tuần nữa bạn sẽ lại được yêu cầu làm. Để giúp công việc sau này nhẹ nhàng hơn, bạn quyết định viết mã sạch ngay hôm nay, để sau này quay lại sẽ dễ hơn.

Chúng ta sẽ bắt đầu bằng cách kết hợp hai hàm của httr đã thấy ở chương trước: GET() để lấy trang web và status_code() để trích xuất mã trạng thái, nhằm tạo ra một hàm trích xuất mã trạng thái.

Vector urls vẫn có sẵn trong không gian làm việc của bạn. Chúng tôi chỉ giữ lại các URL có thể truy cập được.

Bài tập này là một phần của khóa học

Lập trình hàm nâng cao với purrr

Xem khóa học

Hướng dẫn bài tập

  • Khởi chạy purrrhttr.

  • Kết hợp GET()status_code() để tạo một hàm trích xuất trạng thái.

  • Thử hàm mới này với "https://www.thinkr.fr" và "https://en.wikipedia.org".

  • Ánh xạ trực tiếp hàm này lên vector urls.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Chỉnh sửa và Chạy Mã