首頁  >  文章  >  科技週邊  >  使用LangChain和OpenAI API進行文件分析的方法

使用LangChain和OpenAI API進行文件分析的方法

WBOY
WBOY轉載
2023-11-23 11:14:461317瀏覽

譯者需要改寫的內容是:|需要改寫的內容是:布加迪

審查要改寫的內容是:|需要改寫的內容是:重樓

從文件和資料中擷取##洞察力 #對於做出明智的決策至關重要。然而在處理敏感資訊時,會出現隱私問題。 結合使用LangChainOpenAI需要改寫的內容是:API,您就可以分析本機文檔,無需上傳到網路上。

它們透過將資料保存在本地、使用嵌入和向量化進行分析以及在您的環境中執行進程來做到這一點。 OpenAI不使用客戶透過其API#提交的資料來訓練模型或改進服務。

建置環境

建立一個新的Python虛擬環境這將確保沒有程式庫版本衝突。然後執行以下終端命令來安裝所需的庫。

pip需要改写的内容是:install需要改写的内容是:langchain需要改写的内容是:openai需要改写的内容是:tiktoken需要改写的内容是:faiss-cpu需要改写的内容是:pypdf

下面詳細說明您將#如何使用每個函式庫

  • #LangChain#您將使用它來建立和管理用於文字處理和分析的語言鏈。它將提供用於文件載入、文字分割、嵌入和量儲存的模組。
  • OpenAI您將用它來執行查詢並從語言模型取得結果。
  • tiktoken您將用它來計算給定文字中token(文字單位的數量。這是為了在與基於您使用的token數量收費OpenAI需要改寫的內容是:API互動時追蹤token#計數。
  • FAISS您將用它來建立和管理向量存儲,允許基於嵌入快速檢索相似的向量。
  • PyPDF##這個函式庫從PDF提取文字。它有助於載入PDF檔案並提取其文字供進一步處理。
安裝完所有程式庫之後,您的環境

現已準備 #就緒

取得

OpenAI需要改寫的內容是:API金鑰

當您向

OpenAI需要改寫的內容是:API#發出請求時,需要新增 API金鑰作為請求的一部分。 金鑰允許API提供者驗證請求是否來自合法來源,以及您是否擁有存取其功能所需的權限。 為了獲得OpenAI需要改寫的內容是:API金鑰,進入到

OpenAI平台

使用LangChain和OpenAI API进行文档分析的方法

然後在右上方的帳戶

個人資料下,點擊「查看API金鑰#,將出現API金鑰頁面。

使用LangChain和OpenAI API进行文档分析的方法

點選「建立新的金鑰」

#按鈕。 為金鑰命名,點選「建立新金鑰OpenAI將產生API金鑰,您應該複製並保存在安全的地方。出於安全原因,您將無法透過OpenAI#帳戶再次查看它。如果遺失了金鑰,需要產生新的金鑰。

导入所需的库

为了能够使用安装在虚拟环境中的库,您需要导入它们。

from需要改写的内容是:langchain.document_loaders需要改写的内容是:import需要改写的内容是:PyPDFLoader,需要改写的内容是:TextLoaderfrom需要改写的内容是:langchain.text_splitter需要改写的内容是:import需要改写的内容是:CharacterTextSplitterfrom需要改写的内容是:langchain.embeddings.openai需要改写的内容是:import需要改写的内容是:OpenAIEmbeddingsfrom需要改写的内容是:langchain.vectorstores需要改写的内容是:import需要改写的内容是:FAISSfrom需要改写的内容是:langchain.chains需要改写的内容是:import需要改写的内容是:RetrievalQAfrom需要改写的内容是:langchain.llms需要改写的内容是:import需要改写的内容是:OpenAI

注意,您从LangChain导入了依赖,这让您可以使用LangChain框架的特定功能

加载用于分析的文档

先创建一个含API密钥的变量。稍后,您将在代码中使用该变量用于身份验证。

#需要改写的内容是:Hardcoded需要改写的内容是:API需要改写的内容是:keyopenai_api_key需要改写的内容是:=需要改写的内容是:"Your需要改写的内容是:API需要改写的内容是:key"

如果您打算与第三方共享您的代码,不建议对API密钥进行硬编码。对于打算分发的生产级代码,则改而使用环境变量。

接下来,创建一个加载文档的函数。该函数应该加载PDF或文本文件。如果文档既不是PDF文件,也不是文本文件,该函数会抛出值错误

def需要改写的内容是:load_document(filename):if需要改写的内容是:filename.endswith(".pdf"):需要改写的内容是:loader需要改写的内容是:=需要改写的内容是:PyPDFLoader(filename)需要改写的内容是:documents需要改写的内容是:=需要改写的内容是:loader.load()需要改写的内容是:elif需要改写的内容是:filename.endswith(".txt"):需要改写的内容是:loader需要改写的内容是:=需要改写的内容是:TextLoader(filename)需要改写的内容是:documents需要改写的内容是:=需要改写的内容是:loader.load()需要改写的内容是:else:需要改写的内容是:raise需要改写的内容是:ValueError("Invalid需要改写的内容是:file需要改写的内容是:type")

加载文档后,创建一个CharacterTextSplitter。该分割器将基于字符将加载的文档分隔成更小的块。

需要改写的内容是:

text_splitter需要改写的内容是:=需要改写的内容是:CharacterTextSplitter(chunk_size=1000,需要改写的内容是:需要改写的内容是:chunk_overlap=30,需要改写的内容是:separator="\n")需要改写的内容是:return需要改写的内容是:text_splitter.split_documents(documents=documents)

分割文档可确保块的大小易于管理,仍与一些重叠的上下文相连接。这对于文本分析和信息检索之类的任务非常有用。

查询文档

您需要一种方法来查询上传的文档,以便从中获得洞察力。为此,创建一个以查询字符串和检索器作为输入的函数。然后,它使用检索器和OpenAI语言模型的实例创建一个RetrievalQA实例。

def需要改写的内容是:query_pdf(query,需要改写的内容是:retriever):qa需要改写的内容是:=需要改写的内容是:RetrievalQA.from_chain_type(llm=OpenAI(openai_api_key=openai_api_key),需要改写的内容是:chain_type="stuff",需要改写的内容是:retriever=retriever)result需要改写的内容是:=需要改写的内容是:qa.run(query)需要改写的内容是:print(result)

函数使用创建的QA实例来运行查询并输出结果。

创建函数

函数将控制整个程序流。它将接受用户输入的文档文件名并加载该文档。然后为文本嵌入创建OpenAIEmbeddings实例,并基于加载的文档和文本嵌入构造一个量存储。将该向量存储保存到本地文件。

接下来,从本地文件加载持久的量存储。然后输入一个循环,用户可以在其中输入查询。主函数将这些查询持久化向量存储的检索器一起传递给query_pdf函数。循环将继续,直到用户输入exit

def需要改写的内容是:main():需要改写的内容是:filename需要改写的内容是:=需要改写的内容是:input("Enter需要改写的内容是:the需要改写的内容是:name需要改写的内容是:of需要改写的内容是:the需要改写的内容是:document需要改写的内容是:(.pdf需要改写的内容是:or需要改写的内容是:.txt):\n")docs需要改写的内容是:=需要改写的内容是:load_document(filename)embeddings需要改写的内容是:=需要改写的内容是:OpenAIEmbeddings(openai_api_key=openai_api_key)vectorstore需要改写的内容是:=需要改写的内容是:FAISS.from_documents(docs,需要改写的内容是:embeddings)需要改写的内容是:vectorstore.save_local("faiss_index_constitution")persisted_vectorstore需要改写的内容是:=需要改写的内容是:FAISS.load_local("faiss_index_constitution",需要改写的内容是:embeddings)query需要改写的内容是:=需要改写的内容是:input("Type需要改写的内容是:in需要改写的内容是:your需要改写的内容是:query需要改写的内容是:(type需要改写的内容是:'exit'需要改写的内容是:to需要改写的内容是:quit):\n")while需要改写的内容是:query需要改写的内容是:!=需要改写的内容是:"exit":query_pdf(query,需要改写的内容是:persisted_vectorstore.as_retriever())query需要改写的内容是:=需要改写的内容是:input("Type需要改写的内容是:in需要改写的内容是:your需要改写的内容是:query需要改写的内容是:(type需要改写的内容是:'exit'需要改写的内容是:to需要改写的内容是:quit):\n")

嵌入捕获词之间的语义关系。向量是一种可以表示一段文本的形式。

这段代码使用OpenAIEmbeddings生成的嵌入将文档中的文本数据转换向量。然后使用FAISS对这些向量进行索引,以便效地检索和比较相似的向量。这便于对上传的文档进行分析。

最后,如果用户独立运行程序,使用__name__需要改写的内容是:==需要改写的内容是:"__main__"构造函数来调用函数

if需要改写的内容是:__name__需要改写的内容是:==需要改写的内容是:"__main__":需要改写的内容是:main()

这个应用程序是一个命令行应用程序。作为一个扩展,可以使用Streamlit为该应用程序添加Web界面。

执行文件分析

要执行文档分析,将所要分析的文档存储在项目所在的同一个文件夹中,然后运行该程序。它将询问要分析的文档的名称。输入全名,然后输入查询,以便程序分析

以下截图展示了对PDF进行分析的结果

使用LangChain和OpenAI API进行文档分析的方法

下面的輸出顯示了分析包含原始程式碼的文字檔案的結果。

使用LangChain和OpenAI API进行文档分析的方法

確保所要分析的檔案是PDF或文字格式。如果您的文件採用其他格公式,可以使用線上工具將它們轉換成PDF格式

可以在GitHub程式碼庫中取得完整的原始碼:https://github.com/makeuseofcode/Document-analysis-using-LangChain-and-OpenAI

#原文標題:How需要改寫的內容是:to需要改寫的內容是:Analyze需要改寫的內容是:Documents需要改寫的內容是:With需要改寫的內容是:LangChain需要改寫的內容是:and需要改寫的內容是:the需要改寫的內容是:OpenAI需要改寫的內容是:API#,作者:Denis需要改寫的內容是:Kuria

#要改寫的內容是:

以上是使用LangChain和OpenAI API進行文件分析的方法的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述:
本文轉載於:51cto.com。如有侵權,請聯絡admin@php.cn刪除