НачатьНачать бесплатно

Разбиение HTML

В этом упражнении вы разобьёте HTML-файл, содержащий указ об ИИ, выпущенный Белым домом США в октябре 2023 года. Чтобы сохранить как можно больше контекста в каждом фрагменте, используйте большие значения chunk_size и chunk_overlap.

Все необходимые классы LangChain уже загружены для вас.

Это упражнение является частью курса

Разработка LLM-приложений с помощью LangChain

Посмотреть курс

Инструкции к упражнению

  • Создайте UnstructuredHTMLLoader для файла white_house_executive_order_nov_2023.html и загрузите его в память.
  • Задайте значение chunk_size равным 300 и значение chunk_overlap равным 100.
  • Создайте RecursiveCharacterTextSplitter с разбиением по символу '.' и используйте метод .split_documents(), чтобы разбить data и вывести полученные фрагменты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the HTML document into memory
loader = UnstructuredHTMLLoader(____)
data = loader.____()

# Define variables
chunk_size = ____
chunk_overlap = ____

# Split the HTML
splitter = RecursiveCharacterTextSplitter(
    chunk_size=chunk_size,
    chunk_overlap=chunk_overlap,
    separators=____)

docs = splitter.____(data)
print(docs)
Редактировать и запускать код