Tận dụng tính duy nhất của ID
Như bạn biết, ID nên là duy nhất trên một trang web. Nếu bạn đảm bảo được điều này, độ phức tạp của các bộ chọn dùng để trích xuất dữ liệu sẽ giảm đi đáng kể.
Dưới đây là cấu trúc của một trang HTML bạn có thể gặp ngoài thực tế:
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Joe Biden</h1>
<p class = 'first blue'>Democrat</p>
<p class = 'second blue'>Male</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<h1 class = 'big'>Donald Trump</h1>
<p class = 'first red'>Republican</p>
<p class = 'second red'>Male</p>
</div>
</body>
</html>
Nội dung này đã được đọc vào bằng read_html() và có sẵn trong structured_html.
Bài tập này là một phần của khóa học
Web Scraping bằng R
Hướng dẫn bài tập
- Dùng
html_elements()để tìm bộ chọn ngắn nhất có thể nhằm chọndivđầu tiên trongstructured_html.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Select the first div
structured_html %>%
___