
一、引言Agentic AI 的評估核心是測試你的大語言模型LLM應用確保其性能穩定。這個話題或許不算最吸引人但越來越多企業開始關注它。所以搞清楚該跟蹤哪些指標來實際衡量性能很有必要。另外每次推送代碼更新時做好評估也能防止系統出問題。因此本文研究了多輪對話機器人、檢索增強生成RAG和智能體Agentic應用的常見評估指標還簡要介紹了 DeepEval、RAGAS 和 OpenAI 的 Evals 庫等框架幫你明確不同場景下該選哪個工具。二、傳統評估方式基礎入門如果你熟悉自然語言處理NLP任務的評估方法也了解公開基準測試的原理可直接跳過這部分。要是不熟悉建議先了解準確率Accuracy、BLEU 等早期指標的用途和原理以及 MMLU 這類公開基準測試的流程。2.1 自然語言處理任務的評估評估文本分類、翻譯、摘要等傳統 NLP 任務時我們會用到準確率、精確率Precision、F1 分數、BLEU 和 ROUGE 等傳統指標。這些指標至今仍在使用但主要適用于模型輸出單一、易對比的 “正確答案” 的場景。以文本分類為例任務是給每個文本分配一個標簽。此時可通過準確率評估 —— 將模型分配的標簽與評估數據集中的參考標簽對比判斷是否正確。評判標準很明確標簽錯誤得 0 分正確得 1 分。比如用 1000 封郵件的垃圾郵件數據集訓練分類器若模型正確標記了 910 封準確率就是 0.91。文本分類中我們還常使用 F1 分數、精確率和召回率Recall。對于文本摘要、機器翻譯這類 NLP 任務人們常用 ROUGE 和 BLEU 指標判斷模型生成的譯文或摘要與參考文本的吻合度。這兩個指標都會統計重疊的 n 元語法n-grams雖對比方向不同但核心邏輯一致共享的詞語片段越多分數越高。不過這種評估方式比較簡單 —— 若模型輸出用了不同措辭分數就會偏低。總體而言這些傳統指標在 “答案唯一” 的場景下效果最好但對于如今我們搭建的 LLM 應用大多不太適用。2.2 大語言模型基準測試關注行業動態的話你可能會發現每次有新的大語言模型發布都會進行 MMLU Pro、GPQA 或 Big-Bench 等基準測試。這些屬于通用評估正確叫法是 “基準測試Benchmark”而非我們后續會講的 “評估Evals”。盡管每個模型還會接受毒性、幻覺、偏見等方面的評估但最受關注的還是類似 “考試” 或 “排行榜” 的基準測試。MMLU 等數據集以選擇題為主出現已有一段時間。我曾瀏覽過該數據集發現其中存在不少混亂之處。有些問題和答案模糊不清這讓我猜測LLM 提供商可能會針對這些數據集訓練模型確保模型能答對題目。這也引發了公眾的擔憂大多數 LLM 在基準測試中表現優異可能只是過擬合導致因此我們需要更新的數據集和獨立的評估方式。2.3 大語言模型評分器LLM-as-a-judge評估這些數據集時通常可以用準確率和單元測試。但現在有個新變化 —— 出現了 “大語言模型評分器LLM-as-a-judge”。基準測試模型時團隊大多仍用傳統方法。只要是選擇題或答案唯一的場景無需其他操作只需將模型答案與參考答案對比判斷是否完全匹配即可。MMLU、GPQA 等含選擇題答案的數據集就屬于這種情況。對于代碼測試如 HumanEval、SWE-Bench評分器只需運行模型生成的補丁或函數所有測試通過即視為問題解決反之則未解決。但可想而知若問題模糊或屬于開放式問題答案就可能不穩定。這種漏洞催生了 “LLM-as-a-judge”—— 用 GPT-4 這類大語言模型對答案打分。MT-Bench 是采用 LLM 作為評分器的基準測試之一它將兩個競爭的多輪對話答案輸入 GPT-4讓其判斷哪個更好。原本依賴人工評分的 “聊天機器人競技場Chatbot Arena”如今似乎也通過引入 LLM-as-a-judge 來擴大規模。為保證透明度也可使用 BERTScore 等語義評估工具對比語義相似度。為簡潔起見這里就不詳細展開現有工具了。綜上團隊可能仍會用 BLEU、ROUGE 等重疊指標進行快速合理性檢查或在可能的情況下依賴完全匹配解析但如今的新趨勢是用另一個大語言模型來評判輸出結果。三、大語言模型應用的評估方法現在的核心變化是我們不再只測試 LLM 本身而是測試整個系統。只要條件允許我們仍會像以前一樣用程序化方法評估。對于更細微的輸出我們可以先通過 BLEU、ROUGE 這類低成本、確定性的指標查看 n 元語法重疊情況但如今大多數現代框架都會用 LLM 評分器進行評估。有三個領域值得探討多輪對話、RAG 和智能體Agent的評估方法及相關指標。你可以看到這三個領域已定義的指標數量非常多。接下來我們先簡要介紹這些指標再講解能提供幫助的各類框架。3.1 多輪對話評估首先要講的是多輪對話常見于聊天機器人的評估搭建方法。我們與聊天機器人互動時希望對話自然、專業機器人能記住關鍵信息全程不偏離主題且能準確回答問題。目前有不少常用指標可跟蹤首先來看 “相關性 / 連貫性Relevancy/Coherence” 和 “完整性Completeness”。相關性用于跟蹤 LLM 是否恰當回應用戶查詢、不偏離主題完整性若最終結果能滿足用戶需求則該指標得分高。也就是說只要能跟蹤整個對話過程中的用戶滿意度我們就能進一步跟蹤對話是否真的 “降低了支持成本”、“提升了信任度”以及是否 “提高了自助服務率”。其次是 “知識留存Knowledge Retention” 和 “可靠性Reliability”。知識留存機器人是否記住對話中的關鍵細節可靠性能否確保機器人不 “混亂”—— 不僅要記住細節還要能自我修正。在 “氛圍編碼工具vibe coding tools” 中我們常會遇到機器人忘記之前犯的錯誤、反復出錯的情況這種情況就可判定為 “可靠性或穩定性低”。第三是 “角色一致性Role Adherence” 和 “提示對齊Prompt Alignment”。這兩個指標用于跟蹤 LLM 是否堅守給定角色以及是否遵循系統提示中的指令。接下來是與安全性相關的指標如 “幻覺Hallucination” 和 “偏見 / 毒性Bias/Toxicity”。幻覺該指標很重要但評估難度較大。有人會嘗試通過網頁搜索驗證輸出也有人會將輸出拆分為不同斷言用更大規模的模型LLM-as-a-judge 模式評估。還有其他方法比如 SelfCheckGPT—— 對同一提示多次調用模型查看模型是否堅持最初答案、偏離次數多少以此判斷一致性。偏見 / 毒性可通過其他 NLP 方法評估例如用微調后的分類器。此外你可能還需要跟蹤一些應用定制化指標比如代碼正確性、安全漏洞、JSON 格式正確性等。至于評估方式并非一定要用 LLM但多數情況下標準解決方案都會采用 LLM。如果能提取出正確答案如解析 JSON自然無需使用 LLM。正如之前所說許多 LLM 提供商在評估代碼相關指標時也會用單元測試。需要說明的是用于評判的 LLM 并非總是絕對可靠就像它們所評估的應用一樣。但目前我沒有相關數據支持這一點你需要自行調研。3.2 檢索增強生成RAG評估在多輪對話評估的基礎上我們再來看看 RAG 系統需要衡量哪些指標。評估 RAG 系統時需將流程拆分為兩部分分別衡量檢索Retrieval和生成Generation的指標。3.2.1 檢索環節評估首先要評估檢索環節獲取的文檔是否與查詢匹配。如果檢索環節得分低可通過以下方式優化系統制定更優的分塊策略更換嵌入模型Embedding Model加入混合搜索、重排序等技術用元數據過濾等。評估檢索效果既可以用依賴精選數據集的傳統指標也可以用基于 LLM-as-a-judge 的無參考方法。先說說經典的信息檢索IR指標它們是最早出現的檢索評估指標。使用這些指標需要 “黃金答案Gold Answers”—— 即針對某個查詢對每個文檔進行排序。雖然可以用 LLM 構建這類數據集但評估時無需 LLM因為數據集中已有可對比的分數。最知名的 IR 指標包括 Precisionk前 k 個結果的精確率、Recallk前 k 個結果的召回率和 Hitk前 k 個結果中是否有相關文檔。這些指標分別衡量獲取的相關文檔數量、基于黃金參考答案檢索到的相關文檔數量以及結果中是否至少包含一個相關文檔。而 RAGAS、DeepEval 等較新的框架則引入了無參考、LLM 評分式的指標如 Context Recall上下文召回率和 Context Precision上下文精確率。這些指標通過 LLM 判斷基于查詢前 K 個結果中是否包含真正相關的文本塊。簡單來說就是判斷系統是否返回了與查詢相關的文檔或者是否包含過多無關文檔導致無法正確回答問題。構建檢索評估數據集的方法有兩種從真實日志中挖掘問題再由人工整理借助 LLM 使用數據集生成器 —— 多數框架中都有這類工具也有 YourBench 這樣的獨立工具。若你想基于 LLM 搭建自己的數據集生成器可參考以下示例# 生成問題的提示語 qa_generate_prompt_tmpl 以下是上下文信息。 --------------------- {context_str} --------------------- 根據上述上下文信息且不依賴任何先驗知識 基于上述上下文生成{num}個問題和{num}個答案。... 3.2.2 生成環節評估再來看 RAG 系統的生成環節評估模型能否利用提供的文檔準確回答問題。如果該環節表現不佳可通過以下方式調整優化提示詞Prompt調整模型參數如溫度系數 temperature更換模型針對特定領域知識微調模型強制模型通過思維鏈CoT模式推理檢查模型的自我一致性等。評估生成環節時RAGAS 框架的指標很實用包括 Answer Relevancy答案相關性、Faithfulness忠誠度和 Noise Sensitivity噪聲敏感度。答案相關性判斷答案是否真正回應了用戶問題忠誠度判斷答案中的每個斷言是否都有檢索到的文檔支持噪聲敏感度判斷少量無關上下文是否會導致模型輸出偏離正確方向。以 RAGAS 為例其評估第一個指標答案相關性的方式可能是將問題、答案和檢索到的上下文輸入 LLM讓 LLM 按 0-1 分打分“1 分” 表示答案完全貼合問題最終可根據原始分數計算平均值。綜上評估 RAG 系統需將其拆分為檢索和生成兩個環節。既可以用基于 IR 指標的方法也可以用基于 LLM 評分的無參考方法。3.3 智能體Agent評估最后要講的是智能體評估 —— 除了上述提到的輸出、對話和上下文評估智能體還擴展了新的評估指標。評估智能體時我們不僅關注輸出、對話和上下文還要評估它的 “行動能力”能否完成任務或流程完成效率如何是否能在合適的時機調用正確的工具。不同框架對這些指標的命名可能不同但核心要跟蹤的兩個指標是 Task Completion任務完成度和 Tool Correctness工具正確性。工具正確性評估智能體是否為用戶查詢調用了正確的工具。測試時需要內置包含真值的 “黃金腳本Gold Script”但只需編寫一次后續每次修改系統后都可復用。任務完成度評估時需查看完整的操作軌跡和目標按 0-1 分打分并給出理由以此衡量智能體完成任務的效果。此外根據智能體的具體應用場景可能還需要測試前面提到的其他指標。需要注意的是盡管已有不少定義好的指標但不同應用場景需求不同。了解常見指標很有必要但不要默認它們就是最適合你應用的評估指標。四、實用評估框架推薦目前有很多框架可輔助評估工作本文重點介紹幾個常用框架RAGAS、DeepEval、OpenAI 的 Evals 庫和 MLFlow 的 Evals 庫分析它們的優勢和適用場景。你可以在這個代碼倉庫中找到我整理的所有評估框架列表。此外也可以使用一些框架專屬的評估系統如 LlamaIndex尤其適合快速原型開發。OpenAI 和 MLFlow 的 Evals 更偏向 “附加工具”而非獨立框架RAGAS 主要定位為 RAG 應用的指標庫不過也提供其他指標DeepEval 可能是所有框架中功能最全面的評估庫。但需要說明的是這些框架都具備以下功能支持在自定義數據集上運行評估可用于多輪對話、RAG 和智能體評估支持 LLM-as-a-judge允許設置自定義指標兼容持續集成CI流程。正如前面提到的它們的區別主要在功能全面性上MLFlow 最初是為評估傳統機器學習管道設計的因此針對 LLM 應用的指標數量較少OpenAI 的 Evals 框架非常輕量化需要用戶自行設置指標不過它提供了示例庫幫助入門RAGAS 提供了不少指標且可與 LangChain 集成方便運行DeepEval 內置功能豐富甚至包含了 RAGAS 的指標。你可以在這個 GitHub 倉庫中查看上述框架的指標對比表。觀察這些框架提供的指標能大致了解它們的功能覆蓋范圍。需要注意的是提供指標的框架在命名上往往沒有統一標準 —— 不同框架中名稱不同的指標實際含義可能一致。例如一個框架中的 “忠誠度Faithfulness”可能和另一個框架中的 “ groundedness扎根性” 含義相同“答案相關性Answer Relevancy” 可能等同于 “響應相關性Response Relevance”。這種命名混亂給系統評估帶來了不必要的麻煩和復雜性。不過DeepEval 的優勢很突出它提供了 40 多種指標還推出了 G-Eval 框架可幫助快速搭建自定義指標是從 “想法” 到 “可運行指標” 最快的工具。OpenAI 的 Evals 框架則更適合需要定制邏輯的場景而非快速評估需求。據 DeepEval 團隊介紹自定義指標是開發者最常搭建的功能。因此不必糾結于 “哪個框架提供了什么指標”—— 你的應用場景是獨特的評估方式也應如此。那么不同場景該如何選擇框架呢若需要針對 RAG 管道的專用指標且希望最小化配置工作選 RAGAS若需要功能全面、開箱即用的評估套件選 DeepEval若已在使用 MLFlow或偏好內置跟蹤和 UI 功能MLFlow 是不錯的選擇若依賴 OpenAI 基礎設施且需要靈活性OpenAI 的 Evals 框架盡管最精簡更合適。此外DeepEval 還通過其 DeepTeam 框架提供 “紅隊測試Red Teaming” 功能可自動對 LLM 系統進行對抗性測試。其他框架也有類似功能但可能不如 DeepEval 全面。未來我計劃專門探討 LLM 系統的對抗性測試和提示詞注入問題 —— 這是個很有意思的話題。五、注意事項數據集相關業務利潤豐厚因此現在我們能夠用其他 LLM 標注數據或為測試打分這是一個很好的發展階段。但 LLM 評分器并非 “萬能工具”你搭建的評估體系可能會像其他 LLM 應用一樣存在不穩定問題。據網絡信息顯示大多數團隊和企業會每幾周進行一次人工抽樣審核以確保評估的真實性。你為應用搭建的指標很可能是定制化的盡管本文介紹了不少通用指標但最終你或許還是需要自行開發適合自己的評估指標。不過了解這些標準指標仍非常有必要。希望本文能為你提供有價值的參考實現。最后為什么要學AI大模型當下??智能市場迎來了爆發期并逐漸進?以??通?智能AGI為主導的新時代。企業紛紛官宣“ AI ”戰略為新興技術?才創造豐富的就業機會?才缺?將達 400 萬DeepSeek問世以來生成式AI和大模型技術爆發式增長讓很多崗位重新成了炙手可熱的新星崗位薪資遠超很多后端崗位在程序員中穩居前列。與此同時AI與各行各業深度融合飛速發展成為炙手可熱的新風口企業非常需要了解AI、懂AI、會用AI的員工紛紛開出高薪招聘AI大模型相關崗位。最近很多程序員朋友都已經學習或者準備學習 AI 大模型后臺也經常會有小伙伴咨詢學習路線和學習資料我特別拜托北京清華大學學士和美國加州理工學院博士學位的魯為民老師給大家這里給大家準備了一份涵蓋了AI大模型入門學習思維導圖、精品AI大模型學習書籍手冊、視頻教程、實戰學習等錄播視頻全系列的學習資料這些學習資料不僅深入淺出而且非常實用讓大家系統而高效地掌握AI大模型的各個知識點。這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】AI大模型系統學習路線在面對AI大模型開發領域的復雜與深入精準學習顯得尤為重要。一份系統的技術路線圖不僅能夠幫助開發者清晰地了解從入門到精通所需掌握的知識點還能提供一條高效、有序的學習路徑。但知道是一回事做又是另一回事初學者最常遇到的問題主要是理論知識缺乏、資源和工具的限制、模型理解和調試的復雜性在這基礎上找到高質量的學習資源不浪費時間、不走彎路又是重中之重。AI大模型入門到實戰的視頻教程項目包看視頻學習是一種高效、直觀、靈活且富有吸引力的學習方式可以更直觀地展示過程能有效提升學習興趣和理解力是現在獲取知識的重要途徑光學理論是沒用的要學會跟著一起敲要動手實操才能將自己的所學運用到實際當中去這時候可以搞點實戰案例來學習。海量AI大模型必讀的經典書籍PDF閱讀AI大模型經典書籍可以幫助讀者提高技術水平開拓視野掌握核心技術提高解決問題的能力同時也可以借鑒他人的經驗。對于想要深入學習AI大模型開發的讀者來說閱讀經典書籍是非常有必要的。600AI大模型報告實時更新這套包含640份報告的合集涵蓋了AI大模型的理論研究、技術實現、行業應用等多個方面。無論您是科研人員、工程師還是對AI大模型感興趣的愛好者這套報告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學習AI大模型必然是想找到高薪的工作下面這些面試題都是總結當前最新、最熱、最高頻的面試題并且每道題都有詳細的答案面試前刷完這套面試題資料小小offer不在話下這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】