Utnyttja ID:ns unikhet
Som du vet ska ID:n vara unika på en webbsida. Om du kan säkerställa att så är fallet kan det förenkla dina skrapningsselektorer avsevärt.
Här är strukturen på en HTML-sida du kan stöta på i verkligheten:
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Joe Biden</h1>
<p class = 'first blue'>Democrat</p>
<p class = 'second blue'>Male</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<h1 class = 'big'>Donald Trump</h1>
<p class = 'first red'>Republican</p>
<p class = 'second red'>Male</p>
</div>
</body>
</html>
Sidan har lästs in åt dig med read_html() och är tillgänglig via structured_html.
Den här övningen är en del av kursen
Webbskrapning i R
Övningsinstruktioner
- Använd
html_elements()för att hitta den kortast möjliga selektorn för att välja ut den förstadiv:en istructured_html.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select the first div
structured_html %>%
___