你剛接到一個很棒的專案,內容是用 NLP 技術分類法律文件。你的團隊能存取一個最初以新聞文章訓練的預訓練語言模型。為了讓這個專案成功,你需要把這個預訓練模型調整到能有效分類法律文件。
要如何將一個以其他文本類型(例如新聞)訓練的預訓練語言模型,調整為能分類法律文件?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
AI 版圖正快速演變,而大型語言模型(LLMs)站在這場變革的最前線。本章將探討 LLMs 如何推動類人化人工智慧的發展,並透過多元應用改造各行各業。你也會了解語言建模所伴隨的挑戰與複雜度。
本章強調 LLMs 的創新性與湧現能力,同時概述用於資料前處理的各種 NLP 技術。你將學到訓練 LLMs 的挑戰,以及如何透過微調有效因應。你也會理解 N-shot 學習技術如何在標註資料有限時,讓預先訓練的模型能高效適應。
當前練習
在本章中,你將學習訓練一個 LLM 的核心組成要素,例如前置訓練技術。你也會以直觀方式理解如 transformer 架構與注意力機制等複雜概念。本章將介紹進階的微調技術,並總結訓練流程以完成一個 LLM。
本章將深入探討訓練 LLMs 時的關鍵考量,例如大規模資料的可得性、資料品質、標註正確性,以及偏誤資料的影響。你也會檢視多種 LLM 風險,如資料隱私、倫理議題與環境衝擊。最後,將討論新興研究領域與 LLMs 不斷演進的版圖。