Kom igångKom igång gratis

Utnyttja ID:ns unikhet

Som du vet ska ID:n vara unika på en webbsida. Om du kan säkerställa att så är fallet kan det förenkla dina skrapningsselektorer avsevärt.

Här är strukturen på en HTML-sida du kan stöta på i verkligheten:

<html>
  <body>
    <div id = 'first'>
      <h1 class = 'big'>Joe Biden</h1>
      <p class = 'first blue'>Democrat</p>
      <p class = 'second blue'>Male</p>
    </div>
    <div id = 'second'>...</div>
    <div id = 'third'>
      <h1 class = 'big'>Donald Trump</h1>
      <p class = 'first red'>Republican</p>
      <p class = 'second red'>Male</p>
    </div>
  </body>
</html>

Sidan har lästs in åt dig med read_html() och är tillgänglig via structured_html.

Den här övningen är en del av kursen

Webbskrapning i R

Visa kurs

Övningsinstruktioner

  • Använd html_elements() för att hitta den kortast möjliga selektorn för att välja ut den första div:en i structured_html.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select the first div
structured_html %>%
  ___
Redigera och kör kod