可靠(業(yè)務可靠性))
13-Agent評估指標體系Passk能力上限與Pass^k連續(xù)可靠業(yè)務可靠性系列導讀本系列基于李博杰《深入理解AI Agent設計原理與工程實踐》的閱讀思考結合我在智慧農(nóng)業(yè)、無人售貨柜一線的工程實踐展開。這一篇聊一個所有做Agent落地的人都繞不開的話題——評估。一、沒有評估就沒有進步先說一個扎心的現(xiàn)實很多團隊的Agent項目demo驚艷上線翻車。為什么因為從第一天起就沒有一套嚴肅的評估體系。你在測試環(huán)境里手動點五次三次成功就敢說Agent能用了——這不是工程這是抽獎。《深入理解AI Agent》里有一個核心觀點我非常認同Agent的開發(fā)循環(huán)是評估驅(qū)動的。就像深度學習有訓練集/驗證集Agent也需要一套可重復、可量化、可持續(xù)運行的評估體系。你改了一版Prompt、換了一個模型、調(diào)了一次工具描述怎么知道是變好了還是變壞了靠感覺是不行的靠評估。評估的第一步是把成功率這個詞拆開。而拆開之后你會發(fā)現(xiàn)兩個長得極像但意義天差地別的指標Passk和Pass^k。二、Passk能力上限也是技術奇觀的制造機Passk 的定義同一個任務讓Agent獨立嘗試 k 次至少有一次成功的概率。假設單次成功率為 p那么Passk 1 - (1 - p)^k直覺很樸素一次不行就再來一次只要有一次中獎就算贏。取 p 0.6k 5Pass5 1 - (0.4)^5 ≈ 1 - 0.0102 ≈ 98.98% ≈ 99%看單次只有60%的成功率五次嘗試下來成功率直接飆到99%。這就是過去兩年AI圈技術奇觀的數(shù)學原理Anthropic讓模型一周寫出一個C編譯器——背后可能是無數(shù)次嘗試中挑出最好的一次Manus演示虛擬電腦上絲滑操作——演示視頻是剪輯的精華不是連續(xù)實錄OpenClaw直播活人感對話——你看到的是幸存者偏差翻車的那些run沒人給你看。這些不是造假而是Passk視角下的能力展示它衡量的是Agent的能力上限——“最好能做成什么樣”。對于寫代碼、做研究、生成內(nèi)容這類可以人工審查、可以重試的場景Passk是有意義的指標因為挑出一次成功結果的成本很低。三、Pass^k連續(xù)可靠業(yè)務落地的生死線再看 Pass^k 的定義同一個任務連續(xù)做 k 次每一次都成功的概率Pass^k p^k同樣取 p 0.6k 5Pass^5 0.6^5 0.07776 ≈ 7.8%對比一下Pass5 ≈ 99%Pass^5 ≈ 7.8%。同一個Agent同一個任務同一組數(shù)字結論差了十幾個數(shù)量級的體感。這兩個指標的關系可以總結成一句話Passk 衡量能力上限Pass^k 衡量業(yè)務可靠性。前者是技術奇觀的放大器后者是生產(chǎn)系統(tǒng)的入場券。為什么業(yè)務系統(tǒng)看的是Pass^k因為在真實業(yè)務里很多操作是零容忍的支付扣款錯一次就是資損退款審批錯一次要么得罪用戶要么被薅羊毛權限變更錯一次就是安全事故生產(chǎn)部署錯一次就是線上事故凌晨三點被電話叫醒的就是你。在我的無人售貨柜業(yè)務里這感受極其強烈一個用戶掃碼開門取貨自動結算的Agent識別錯了、扣款錯了用戶直接投訴客訴一次的成本遠高于它正確服務一百次創(chuàng)造的價值。這類場景下60%的單次成功率意味著什么意味著每五單就有兩單可能出問題——這不是產(chǎn)品這是定時炸彈。所以做Agent落地第一件事是問自己我的業(yè)務是Passk業(yè)務還是Pass^k業(yè)務內(nèi)容生成、代碼輔助、研究分析 → Passk業(yè)務允許重試和人工挑選支付、結算、庫存扣減、設備控制 → Pass^k業(yè)務必須連續(xù)可靠。四、光看成功率不夠過程指標體系《深入理解AI Agent》強調(diào)評估要做軌跡與結果雙重覆蓋——只看最終結果你不知道Agent是怎么到達的只看過程你不知道結果對不對。一套完整的過程指標至少包括行動合法率Agent執(zhí)行的動作是否在允許的動作空間內(nèi)。比如退款Agent跑去調(diào)用庫存查詢工具修改數(shù)據(jù)就是非法動作工具調(diào)用正確率參數(shù)對不對、調(diào)用的工具對不對。工具選對但參數(shù)傳錯是新手Agent最常見的病路徑效率完成任務用了多少步、多少token。10步能完成的事走了47步即使結果對了延遲和成本也不可接受檢索覆蓋率RAG場景召回的文檔里是否包含了回答問題所需的信息召回不行生成再好也是巧婦難為無米之炊成本與延遲單次任務的token消耗、端到端耗時這直接決定這個Agent在商業(yè)上能不能活下去。五、一票否決項安全合規(guī)與幻覺過程指標是打分題但有些是判斷題而且判錯直接零分安全合規(guī)一票否決Agent把敏感數(shù)據(jù)發(fā)給外部API、執(zhí)行了越權操作、輸出了違規(guī)內(nèi)容——無論任務完成得多漂亮這條軌跡直接判負幻覺一票否決在事實性任務里編造不存在的訂單號、虛構退款政策條款。對售貨柜退款Agent來說編造一個不存在的優(yōu)惠券規(guī)則說服用戶比承認查不到嚴重一百倍。幻覺不是扣分項是出局項。六、魯棒性別只在晴天測試很多Agent在標準環(huán)境里表現(xiàn)優(yōu)秀一到線上就崩。魯棒性評估要做擾動測試隨機種子擾動同一輸入多次運行輸出是否穩(wěn)定溫度、采樣帶來的方差有多大頁面/環(huán)境變化操作網(wǎng)頁的Agent按鈕換個位置、彈個新彈窗就傻了API抖動工具接口偶發(fā)超時、返回異常格式Agent是優(yōu)雅重試還是直接躺平長時記憶干擾多輪會話中早前的上下文是否污染當前決策。七、人工抽檢與對抗式評審自動化評估再好也不能100%代替人。實踐建議人工抽檢按比例抽查軌跡重點看自動評估判成功的樣本——機器覺得對的不一定真對對抗式評審讓一個人專門扮演找茬的構造邊界case、誘導性輸入、異常數(shù)據(jù)去攻擊Agent。攻擊者的視角永遠比建設者毒辣。八、實戰(zhàn)售貨柜退款Agent的評估表給一個我們真實在用的評估框架縮影。退款Agent的任務用戶投訴掃碼扣款了但沒拿到貨Agent需要查訂單、查柜機日志、判斷責任、執(zhí)行退款或拒絕。維度指標目標值結果Pass^20連續(xù)20個真實退款案例全對≥ 95%幻覺虛構訂單/政策條款0 容忍安全只允許調(diào)用退款白名單工具0 違規(guī)路徑效率平均工具調(diào)用步數(shù)≤ 6 步成本單案例token成本≤ ¥0.05魯棒性柜機日志接口超時5s時正確降級100%注意第一條我們考核的是Pass^20 而不是 Pass20。因為每一筆退款都是真實的錢用戶不會給你重試五次的機會。小結Passk 1-(1-p)^k衡量能力上限是技術奇觀的數(shù)學來源Pass^k p^k衡量業(yè)務可靠性是生產(chǎn)系統(tǒng)的生死線p0.6 時 Pass5≈99% 但 Pass^5≈7.8%同一個模型兩種命運結果指標之外補齊行動合法率、工具調(diào)用正確率、路徑效率、成本延遲等過程指標安全合規(guī)與幻覺是一票否決不是扣分項用軌跡結果雙重覆蓋、擾動測試、人工抽檢和對抗式評審把評估做成體系而不是一次性的表演。評估做得好Agent的每一次迭代才有方向沒有評估的迭代只是在換著花樣碰運氣。