ÎncepețiÎncepe gratuit

Selectează direct dintr-un element părinte cu funcția text() din XPATH

În acest exercițiu, vei lucra cu același tabel. De data aceasta, vei extrage informațiile despre funcție din paranteze într-o coloană separată, așadar va trebui să obții un data frame cu nu două, ci trei coloane: actori, roluri și funcții.

Pentru a face asta, va trebui să aplici funcția XPATH specifică prezentată în video, în locul html_table(), care în practică nu funcționează întotdeauna atunci când elementul HTML table nu este bine structurat – ca în cazul de față.

Pentru referință, iată din nou un fragment din HTML-ul tabelului:

<table>
 <tr>
  <th>Actor</th>
  <th>Role</th>
 </tr>
 <tr>
  <td class = 'actor'>Jayden Carpenter</td>
  <td class = 'role'><em>Mickey Mouse</em> (Voice)</td>
 </tr>
 ...
</table>

În acest exercițiu, variabila roles_html conține documentul HTML împreună cu elementul său table.

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract the actors in the cells having class "actor"
actors <- roles_html %>% 
  html_elements(xpath = '//table//td[@class = "actor"]') %>%
  html_text()
actors

# Extract the roles in the cells having class "role"
roles <- roles_html %>% 
  html_elements(xpath = '//table//td[@class = "___"]/___') %>% 
  ___()
roles
Editează și rulează codul