Разбиение HTML
В этом упражнении вы разобьёте HTML-файл, содержащий указ об ИИ, выпущенный Белым домом США в октябре 2023 года. Чтобы сохранить как можно больше контекста в каждом фрагменте, используйте большие значения chunk_size и chunk_overlap.
Все необходимые классы LangChain уже загружены для вас.
Это упражнение является частью курса
Разработка LLM-приложений с помощью LangChain
Инструкции к упражнению
- Создайте
UnstructuredHTMLLoaderдля файлаwhite_house_executive_order_nov_2023.htmlи загрузите его в память. - Задайте значение
chunk_sizeравным300и значениеchunk_overlapравным100. - Создайте
RecursiveCharacterTextSplitterс разбиением по символу'.'и используйте метод.split_documents(), чтобы разбитьdataи вывести полученные фрагменты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the HTML document into memory
loader = UnstructuredHTMLLoader(____)
data = loader.____()
# Define variables
chunk_size = ____
chunk_overlap = ____
# Split the HTML
splitter = RecursiveCharacterTextSplitter(
chunk_size=chunk_size,
chunk_overlap=chunk_overlap,
separators=____)
docs = splitter.____(data)
print(docs)