文章目录
加载pdf(PyPDFLoader),加载Markdown(UnstructuredMarkdownLoader),加载HTML(UnstructuredHTMLLoader),加载File Directory(DirectoryLoader)。
1 文档相关类简介
了解:BaseLoader、Document类
(1)一方面:LangChain在设计时,要保证Source中多种不同的数据源,在接下来的流程中可以用一种统一的形式读取、调用。
(2)另一方面:为什么PDFloader和TextLoader等Document Loader都使用load()去加载,且都使用.page_content和.metadata读取数据?
【解答】每一个在LangChain中集成的文档加载器,都要继承自BaseLoader(文档加载器),BaseLoader提供了一个名为"load"的公开方法,用于从配置的不同数据源加载数据,全部作为Document对象。
1.1 BaseLoader类分析
BaseLoader类定义了如何从不同的数据源加载文档,每个基于不同数据源实现的loader,都需要继承BaseLoader。Baseloader要求不多,对于任何具体实现的loader,最少都要实现load方法。
BaseLoader把数据加载成Documents object ,存到 Documents类中的page_content中。
订阅专栏 解锁全文

403

被折叠的 条评论
为什么被折叠?



