НачатьНачать бесплатно

Загрузка HTML-файлов для RAG

Документы можно загружать из множества различных форматов, включая такие сложные, как HTML.

Если вы не знакомы с HTML, это язык разметки для создания веб-страниц. Вот небольшой пример:

<!DOCTYPE html>
<html>
<body>
  <h2>Heading</h2>
  <p>Here's some text and an image below:</p>
  <img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>

В этом упражнении вы загрузите HTML-файл, содержащий страницу публикации из блога DataCamp. Необходимые классы уже импортированы.

Это упражнение является частью курса

Retrieval Augmented Generation (RAG) с LangChain

Посмотреть курс

Инструкции к упражнению

  • Используйте класс UnstructuredHTMLLoader, чтобы загрузить файл datacamp-blog.html из текущего каталога.
  • Загрузите документы в память.
  • Выведите содержимое первого документа.
  • Выведите метаданные первого документа.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a document loader for unstructured HTML
loader = ____

# Load the document
data = ____

# Print the first document's content
print(____)

# Print the first document's metadata
print(____)
Редактировать и запускать код