
前言Dify 是一款開源的大模型應用開發平臺旨在幫助開發者快速構建生產級生成式 AI 應用。在Dify 本地化部署中知識庫功能是實現企業級 AI 應用的核心能力。本文介紹基于版本 1.5.1 搭建知識庫全流程解析一、Dify基本概念Dify 是一款開源的大模型應用開發平臺旨在幫助開發者快速構建生產級生成式 AI 應用。它集成了模型管理、提示詞工程、數據檢索、工作流編排和運維監控等核心功能支持數百種開源及商業大模型如 Llama3、GPT-4、Claude 等并提供可視化工作流設計、RAG檢索增強生成管道、Agent 智能體框架等特色能力。其核心特點包括1. 低代碼/無代碼界面通過可視化編排 Prompt、連接知識庫、配置 Agent 工作流降低 AI 開發門檻。2. 技術棧整合內置 RAG 管道、多模型支持如 OpenAI、本地模型、可觀測性工具避免重復開發基礎組件。3. 開源與自托管代碼完全開放支持 Docker 私有化部署確保數據隱私與合規性。二、Dify本地部署1. Docker部署2. Dify部署硬件要求CPU ≥ 2 核RAM ≥ 4GB推薦 8GB 以上以運行中等模型# 克隆倉庫git clone https://github.com/langgenius/dify.git cd dify/docker# 復制環境配置cp .env.example .env# 啟動容器sudo docker compose up -d驗證服務**訪問 http://localhost/install**初始化管理員賬號。3. 模型配置在“設置”—“模型供應商”中自定義配置所需的大模型API-KEY類型包括Chat、Text Embedding、Rerank模型。三、基于Dify的知識庫搭建1. Dify知識庫介紹Dify 知識庫系統通過**RAG檢索增強生成**技術實現核心流程LLM 接收到用戶的問題后將首先基于關鍵詞在知識庫內檢索內容。知識庫將根據關鍵詞召回相關度排名較高的內容區塊向 LLM 提供關鍵上下文以輔助其生成更加精準的回答。開發者可以通過此方式確保 LLM 不僅僅依賴于訓練數據中的知識還能夠處理來自實時文檔和數據庫的動態數據從而提高回答的準確性和相關性。支持多種文本類型例如長文本內容TXT、Markdown、DOCX、HTML、JSON 甚至是 PDF結構化數據CSV、Excel 等在線數據源網頁爬蟲、Notion 等將文件上傳至“知識庫”即可自動完成數據處理。如果內部已建有獨立知識庫可以通過連接外部知識庫與 Dify 建立連接。2. 知識庫搭建“知識庫”—“創建知識庫”—“選擇數據源”選擇作為知識庫的來源。2.1 指定分段模式知識庫支持兩種分段模式通用模式與父子模式。如果你是首次創建知識庫建議選擇父子模式。1通用模式系統按照用戶自定義的規則將內容拆分為獨立的分段在該模式下需要根據不同的文檔格式或場景要求參考以下設置項設置文本的分段規則。分段標識符如\n可以遵循正則表達式語法自定義分塊規則系統將在文本出現分段標識符時自動執行分段。下圖是不同語法的文本分段效果分段最大長度指定分段內的文本字符數最大上限超出該長度時將強制分段。默認值為 500 Tokens分段長度的最大上限為 4000 Tokens**分段重疊長度**指的是在對數據進行分段時段與段之間存在一定的重疊部分。這種重疊可以幫助提高信息的保留和分析的準確性提升召回效果。建議設置為分段長度 Tokens 數的 10-25%配置完成后點擊“預覽區塊”即可查看分段后的效果。可以直觀的看到每個區塊的字符數。如果重新修改了分段規則需要重新點擊按鈕以查看新的內容分段。若同時批量上傳了多個文檔輕點頂部的文檔標題快速切換并查看其它文檔的分段效果。2父子模式與通用模式相比父子模式采用雙層分段結構來平衡檢索的精確度和上下文信息,讓精準匹配與全面的上下文信息二者兼得。其中**父區塊Parent-chunk保持較大的文本單位如段落提供豐富的上下文信息子區塊Child-chunk則是較小的文本單位如句子用于精確檢索。系統首先通過子區塊進行精確檢索以確保相關性然后獲取對應的父區塊來補充上下文信息從而在生成響應時既保證準確性又能提供完整的背景信息。**可以通過設置分隔符和最大長度來自定義父子區塊的分段方式。例如在 AI 智能客服場景下用戶輸入的問題將定位至解決方案文檔內某個具體的句子隨后將該句子所在的段落或章節聯同發送至 LLM補全該問題的完整背景信息給出更加精準的回答。其基本機制包括子分段匹配查詢將文檔拆分為較小、集中的信息單元例如一句話更加精準地匹配用戶所輸入的問題。子分段能快速提供與用戶需求最相關的初步結果。父分段提供上下文將包含匹配子分段的更大部分如段落、章節甚至整個文檔視作父分段并提供給大語言模型LLM。父分段能為 LLM 提供完整的背景信息避免遺漏重要細節幫助 LLM 輸出更貼合知識庫內容的回答。配置完成后點擊“預覽區塊”即可查看分段后的效果。可以查看父分段的整體字符數。背景標藍的字符為子分塊同時顯示當前子段的字符數。3兩種模式的區別兩者的主要區別在于內容區塊的分段形式。通用模式的分段結果為多個獨立的內容分段而父子模式采用雙層結構進行內容分段即單個父分段的內容文檔全文或段落內包含多個子分段內容句子。不同的分段方式將影響LLM對于知識庫內容的檢索效果。在相同文檔中采用父子檢索所提供的上下文信息會更全面且在精準度方面也能保持較高水平大大優于傳統的單層通用檢索方式。2.2 索引方法與檢索設置提供高質量與經濟兩種索引方法其中分別提供不同的檢索設置選項在高質量模式下使用Embedding嵌入模型將已分段的文本塊轉換為數字向量幫助更加有效地壓縮與存儲大量文本信息使得用戶問題與文本之間的匹配能夠更加精準。將內容塊向量化并錄入至數據庫后需要通過有效的檢索方式調取與用戶問題相匹配的內容塊。高質量模式提供向量檢索、全文檢索和混合檢索三種檢索設置。1向量檢索定義向量化用戶輸入的問題并生成查詢文本的數學向量比較查詢向量與知識庫內對應的文本向量間的距離尋找相鄰的分段內容。**Rerank****模型**默認關閉。開啟后將使用第三方Rerank模型再一次重排序由向量檢索召回的內容分段以優化排序結果。幫助LLM獲取更加精確的內容輔助其提升輸出的質量。TopK****用于篩選與用戶問題相似度最高的文本片段。系統同時會根據選用模型上下文窗口大小動態調整片段數量。默認值為 3數值越高預期被召回的文本分段數量越多。**Score閾值**用于設置文本片段篩選的相似度閾值只召回超過設置分數的文本片段默認值為 0.5。數值越高說明對于文本與問題要求的相似度越高預期被召回的文本數量也越少。2全文檢索定義關鍵詞檢索即索引文檔中的所有詞匯。用戶輸入問題后通過明文關鍵詞匹配知識庫內對應的文本片段返回符合關鍵詞的文本片段類似搜索引擎中的明文檢索。**Rerank****模型**默認關閉。開啟后將使用第三方Rerank模型再一次重排序由全文檢索召回的內容分段以優化排序結果。向LLM發送經過重排序的分段輔助其提升輸出的內容質量。3混合檢索定義同時執行全文檢索和向量檢索或Rerank模型從查詢結果中選擇匹配用戶問題的最佳結果。權重設置允許用戶賦予語義優先和關鍵詞優先自定義的權重。關鍵詞檢索指的是在知識庫內進行全文檢索Full Text Search語義檢索指的是在知識庫內進行向量檢索Vector Search。Rerank模型默認關閉開啟后將使用第三方Rerank模型再一次重排序由混合檢索召回的內容分段以優化排序結果。3.知識庫使用運用Dify內置的應用模板創建基于知識庫的問答系統“工作室”—“從應用模板創建”—“Knowledge Retreival Chatbot”在“Knowledge Retrieval”組件配置知識庫名稱和召回設置在“LLM”組件中設置模型類型及將知識庫檢索結果作為上下文設置完成后進行預覽測試可在工作流中查看每一步的運行情況在“Knowledge Retrieval”輸出中可查看知識庫的檢索結果總結Dify通過知識庫索引優化、多模態支持和動態參數校驗構建了企業級 AI 知識庫的完整技術棧。其本地化部署方案在數據安全GDPR/HIPAA 合規、性能和成本上具有顯著優勢。無論是醫療、金融還是制造業均可通過 Dify 實現私有數據的智能管理與精準應用。建議企業結合自身業務場景靈活運用 FireCrawl 爬取、Xinference 模型部署等擴展方案打造貼合需求的行業級知識庫系統。最后為什么要學AI大模型當下??智能市場迎來了爆發期并逐漸進?以??通?智能AGI為主導的新時代。企業紛紛官宣“ AI ”戰略為新興技術?才創造豐富的就業機會?才缺?將達 400 萬DeepSeek問世以來生成式AI和大模型技術爆發式增長讓很多崗位重新成了炙手可熱的新星崗位薪資遠超很多后端崗位在程序員中穩居前列。與此同時AI與各行各業深度融合飛速發展成為炙手可熱的新風口企業非常需要了解AI、懂AI、會用AI的員工紛紛開出高薪招聘AI大模型相關崗位。最近很多程序員朋友都已經學習或者準備學習 AI 大模型后臺也經常會有小伙伴咨詢學習路線和學習資料我特別拜托北京清華大學學士和美國加州理工學院博士學位的魯為民老師給大家這里給大家準備了一份涵蓋了AI大模型入門學習思維導圖、精品AI大模型學習書籍手冊、視頻教程、實戰學習等錄播視頻全系列的學習資料這些學習資料不僅深入淺出而且非常實用讓大家系統而高效地掌握AI大模型的各個知識點。這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】AI大模型系統學習路線在面對AI大模型開發領域的復雜與深入精準學習顯得尤為重要。一份系統的技術路線圖不僅能夠幫助開發者清晰地了解從入門到精通所需掌握的知識點還能提供一條高效、有序的學習路徑。但知道是一回事做又是另一回事初學者最常遇到的問題主要是理論知識缺乏、資源和工具的限制、模型理解和調試的復雜性在這基礎上找到高質量的學習資源不浪費時間、不走彎路又是重中之重。AI大模型入門到實戰的視頻教程項目包看視頻學習是一種高效、直觀、靈活且富有吸引力的學習方式可以更直觀地展示過程能有效提升學習興趣和理解力是現在獲取知識的重要途徑光學理論是沒用的要學會跟著一起敲要動手實操才能將自己的所學運用到實際當中去這時候可以搞點實戰案例來學習。海量AI大模型必讀的經典書籍PDF閱讀AI大模型經典書籍可以幫助讀者提高技術水平開拓視野掌握核心技術提高解決問題的能力同時也可以借鑒他人的經驗。對于想要深入學習AI大模型開發的讀者來說閱讀經典書籍是非常有必要的。600AI大模型報告實時更新這套包含640份報告的合集涵蓋了AI大模型的理論研究、技術實現、行業應用等多個方面。無論您是科研人員、工程師還是對AI大模型感興趣的愛好者這套報告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學習AI大模型必然是想找到高薪的工作下面這些面試題都是總結當前最新、最熱、最高頻的面試題并且每道題都有詳細的答案面試前刷完這套面試題資料小小offer不在話下這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】