:Agent 身份、意圖、權力、上下文風險)
Working Draft · AI Era Execution Security LanguageThis article is part of the Havenlon Execution Security Language project.The terminology and definitions presented here describe the currentworking draft and may evolve as the discipline matures.AI 時代執行安全語言體系工作草案本系列旨在建立 AI 時代執行安全的共同語言。本文中的術語與定義代表當前工作草案將隨著理論研究、工程實踐和社區討論持續修訂14. Agent Authority智能體權力一句話定義智能體權力是 Agent 能夠提出、選擇、請求或實際觸發動作的能力范圍。嚴格定義Agent Authority 必須拆分為提議權讀取權規劃權工具選擇權工具請求權有限自主執行權治理參與權恢復權。這些權力不能混為一體。例如一個 Agent 可以讀取告警生成修復方案提議重啟服務但不一定有權直接重啟生產集群修改管理員權限關閉安全控制增加自己的工具權限。上位概念Execution AuthorityDelegated Authority下位概念Agent Proposal AuthorityAgent Tool AuthorityAgent Execution AuthorityAgent Governance AuthorityAgent Recovery Authority相關概念Tool PermissionDelegated ExecutionNo Unilateral Catastrophic AuthorityAuthority InheritanceScope Limit權力邊界Agent 權力必須是有限、可撤銷、不可自動擴張且不可無條件傳遞的。約束機制權力拆分最小權限非傳遞授權時間限制對象限制高風險轉治理權力變更留證。結果目標讓 Agent 能夠完成任務但無法將任務能力擴張為系統主權。在 Havenlon 中Agent 默認擁有 Proposer 權力只有低風險預授權槽位提供有限執行能力。15. Agent Identity智能體身份一句話定義智能體身份是用于區分某個 Agent 實例、角色、模型、部署環境和權限主體的可驗證身份。嚴格定義Agent Identity 可以包含agent_idagent typemodel versiondeploymentownerorganizationrolecredentialtool scoperuntime environmentcurrent policylifecycle state。系統必須區分用戶身份Agent 身份代表用戶行動的委托關系Agent 使用的服務賬戶工具底層憑證。不能把 Agent 的所有動作都歸因于擁有者本人。上位概念IdentityMachine Identity下位概念Agent Instance IdentityAgent Role IdentityModel IdentityRuntime IdentityDelegated Agent Identity相關概念Agent AuthorityIntent OriginService AccountDevice IdentityEvidence Chain權力邊界Agent 不能使用用戶或管理員的長期身份直接執行所有動作也不能在多個 Agent 之間共享不可區分的憑證。約束機制獨立憑證Agent ID工作負載身份短期 Token工具作用域實例證據權限撤銷。結果目標讓每個機器發起動作能夠追溯到具體 Agent而不是只顯示“系統執行”。在 Havenlon 中Agent Identity 進入 Proposal Evidence并與委托者身份和 Execution Intent 分開記錄。16. Agent Intent智能體意圖一句話定義智能體意圖是 Agent 根據目標和上下文生成的、希望系統執行的結構化動作表達。嚴格定義Agent Intent 必須與以下內容區分用戶原始目標Agent 對目標的解釋當前上下文Tool Call最終 Payload。例如用戶目標可能是解決這個客戶問題。Agent Intent 可能被具體化為向客戶賬戶退款 500 元。隨后 Tool Payload 可能是refund(account_x, amount500)安全系統必須驗證Agent 的具體化是否合理金額是否符合授權對象是否正確當前上下文是否完整是否需要人工確認最終 Payload 是否仍等于該 Intent。上位概念Execution IntentMachine-Initiated Intent下位概念Agent-Proposed IntentAgent-Derived IntentAgent-Revised IntentMulti-Agent Intent相關概念Human IntentIntent DriftContext InjectionTool CallingIntent Binding權力邊界Agent 對用戶目標的解釋不能自動成為不可逆執行事實。約束機制Intent 結構化目標來源引用語義摘要金額與對象顯式化IntentHash高風險重新確認最終綁定。結果目標把模型的開放式推理結果收斂為可驗證、可審批和可拒絕的具體動作。在 Havenlon 中Agent 輸出必須先轉換為標準 Execution Intent不能把自然語言推理直接送給 Executor。17. Agent Hallucination智能體幻覺一句話定義智能體幻覺是 Agent 生成了不受事實支持、錯誤、不完整或虛構的判斷、參數、狀態或行動依據。嚴格定義Agent Hallucination 可能影響對象金額時間身份工具能力系統狀態執行結果Policy用戶授權外部事實。在純內容場景中幻覺可能產生錯誤回答。在執行場景中幻覺可能變成錯誤 Tool Call錯誤參數錯誤目標不必要執行重復執行虛假成功判斷錯誤恢復動作。上位概念Model ErrorAgent Risk下位概念Parameter HallucinationState HallucinationPermission HallucinationTool HallucinationResult Hallucination相關概念Semantic GapTool MisuseFinal RevalidationFact SourceExecution Drift權力邊界模型輸出不能被視為事實來源也不能因為置信表達強烈而獲得執行資格。約束機制外部事實驗證結構化字段對象白名單參數上限Tool Schema獨立 Policy執行前重新驗證。結果目標讓模型錯誤停留在候選判斷階段而不是直接成為現實動作。在 Havenlon 中Agent 的判斷只作為 Proposal 輸入事實和執行條件由獨立系統重新驗證。18. Prompt Injection提示注入一句話定義提示注入是攻擊者通過輸入內容影響 Agent 的指令理解、目標優先級、工具選擇或執行行為的攻擊方式。嚴格定義Prompt Injection 可以來自用戶輸入網頁郵件文件數據庫內容工具返回其他 Agent長期記憶RAG 文檔外部 API。攻擊內容可能誘導 Agent忽略系統指令泄露信息調用高風險工具修改執行目標擴大作用域偽造審批隱藏行為執行攻擊者指定動作。Prompt Injection 的核心危險不是“模型被說服”而是被污染內容是否能夠穿過 Agent獲得真實執行能力。上位概念Adversarial InputContext Attack下位概念Direct Prompt InjectionIndirect Prompt InjectionTool-Result InjectionMemory InjectionCross-Agent Injection相關概念Context InjectionTool MisusePolluted IntentLegitimate-Path AbuseTool Execution Boundary權力邊界外部文本不能因為進入 Agent 上下文就自動改變執行 Policy、工具權限或治理狀態。約束機制內容與指令分離不信任外部上下文工具權限外置高風險 Intent 顯式化獨立審批Payload Binding最終硬件拒絕。結果目標讓提示注入最多影響 Agent 的候選輸出不能直接繼承成最終執行權。在 Havenlon 中即使 Agent 被注入并生成惡意 Tool Call最終仍需經過獨立 Execution Intent、Policy 和本地執行邊界。19. Context Injection上下文注入一句話定義上下文注入是攻擊者或異常系統將誤導性、偽造、過期或惡意信息加入 Agent 上下文從而改變其判斷和執行計劃。嚴格定義Context Injection 比 Prompt Injection 更廣。它可以包括偽造業務狀態污染記憶修改檢索結果插入虛假審批返回惡意工具結果提供過期 Policy偽造用戶意圖隱藏關鍵限制篡改歷史事件。Agent 可能并未違反任何顯式提示卻基于錯誤上下文得出危險結論。上位概念Context PollutionAdversarial Context下位概念Memory InjectionRAG InjectionTool Output InjectionState InjectionIdentity Context Injection相關概念Polluted ContextAgent IntentContext IntegrityPrompt InjectionFact Source權力邊界Agent 上下文不能作為治理、Policy、身份和執行事實的唯一來源。約束機制來源標記數據簽名事實分層新鮮度多源核驗Context Binding最終本地狀態。結果目標阻止被污染的上下文直接決定不可逆執行。在 Havenlon 中關鍵治理、Policy 和執行狀態從受驗證來源讀取而不是只相信 Agent 當前上下文。