ÎncepețiÎncepe gratuit

Profită de unicitatea ID-urilor

Așa cum știi, ID-urile ar trebui să fie unice pe o pagină web. Dacă te poți asigura că este cazul, poți reduce considerabil complexitatea selectorilor folosiți la scraping.

Iată structura unei pagini HTML pe care ai putea-o întâlni în practică:

<html>
  <body>
    <div id = 'first'>
      <h1 class = 'big'>Joe Biden</h1>
      <p class = 'first blue'>Democrat</p>
      <p class = 'second blue'>Male</p>
    </div>
    <div id = 'second'>...</div>
    <div id = 'third'>
      <h1 class = 'big'>Donald Trump</h1>
      <p class = 'first red'>Republican</p>
      <p class = 'second red'>Male</p>
    </div>
  </body>
</html>

Pagina a fost citită pentru tine cu read_html() și este disponibilă prin variabila structured_html.

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosind html_elements(), găsește cel mai scurt selector posibil pentru a selecta primul div din structured_html.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Select the first div
structured_html %>%
  ___
Editează și rulează codul