
Agentic Method—— 不是更多的 prompt而是一套讓模型輸出更可觀測、可證偽、可進化的工作流。GitHub: https://github.com/Ghost-Silver/Agentic-Method一個越來越明顯的問題現在的 LLM尤其是中檔模型指令遵循能力已經很強了。你讓它按格式輸出、按步驟執行、調用工具它基本都能做到。但一到復雜任務——比如審查一個多文件代碼改動、設計一組對照實驗、或者推理一個系統 bug 的根因——模型就開始出現兩種典型失敗幻覺自信地給出沒有依據的結論。事后合理化先跳到一個答案再編造一個看似合理的推理過程fake CoT。這些不是模型“不夠聰明”而是模型的解碼空間太大沒有足夠的外部約束把它錨定在“正確思考”的軌道上。我們的思路用方法論約束解碼空間我們開源的Agentic Method本質上不是一套“提示詞合集”而是一套元工作流meta-workflow。它通過四個機制把模型的思考過程外化、結構化、可審計1. 嚴格 DSL 錨定用類似(CTX)、(H)、(PREDICTION)、(OBSERVATION)、(VERDICT)的標簽強制模型在每個關鍵節點聲明當前上下文是什么假設是什么可證偽的預測是什么實際觀測到了什么最終裁決是什么這能把模型的輸出從“自由作文”變成“結構化科研記錄”顯著降低幻覺。2. 強制深層推理每個關鍵結論必須附帶證據等級F0-F4置信度(CONF: level, 證據統計)至少一個競爭假設(BRANCH)明確的證偽條件(FALSIFICATION)模型不能再停留在表面回答。3. 子 Agent 交叉審查通過FORM_REVIEWER、HYPOTHESIS_VALIDATOR、COUNTEREXAMPLE_REVIEWER等角色讓不同 Agent 互相挑錯。循環論證、隱藏假設、事后合理化會被顯式標記出來。4. 引入科研方法二分、消融、對照、反事實推理——這些方法不是作為“建議”寫在文檔里而是作為不可跳過的步驟嵌入 prompt。30 個核心 prompt覆蓋高風險任務倉庫里包含了 30 個已經脫敏、可直接復用的核心 promptexperimental-design-prompt.md設計可驗證的實驗logical-inference-prompt.md嚴格邏輯推理與證明審查code-review-prompt.md系統性代碼審查debug-prompt.md因果排查與修復performance-optimization-prompt.md性能優化決策prompt-evolution-prompt.md讓 prompt 自己進化自己subagent-protocol.md18 個子 Agent 角色的協作協議……以及更多所有 prompt 都遵循同一套 DSL可以按需加載、組合、演化。Prompt 自動進化PEL最有意思的部分可能是Prompt Evolution LoopPEL。它的思路很簡單對同一個種子 prompt自動生成多個變異版本用同一組真實任務并行評測然后保留適應度最高的變體。我們已經在示例報告中展示了一次真實的 PEL 運行結果CONSTRAINT_ADD算子修復了一個 P0 級協議一致性缺陷ANTI_PATTERN_BLOCK算子因為與既有規則矛盾而被廢棄EXAMPLE_INJECT算子需要與清單化調用點結合才有效。這些結論本身就是 prompt 工程從“玄學”走向“可實驗科學”的證據。推薦配置這套方法論是為了高風險任務設計的會消耗更多 token 和上下文。但我們認為值得。主 Agent / 編排層推薦 200B、200K 上下文的強模型子 Agent / 審查層可以用更便宜的中等模型運行方式先讀main.md再按需加載對應 prompt。適用場景復雜代碼審查與架構決策Bug 根因排查性能優化實驗設計科研論證與技術調研任何“說錯一句話代價很高”的任務開源MIT 協議我們希望這套方法能被更多人驗證、改進、應用到不同領域。如果你成功把它用到了軟件工程或科研之外的領域用 PEL 進化出了更好的 prompt 變體發現了某個 prompt 的漏洞歡迎在 GitHub 上開 Issue 或 PR。社區會一起積累更多領域的 adapter 和最佳實踐。下一步打開倉庫https://github.com/Ghost-Silver/Agentic-Method從core/master-prompt.md開始讀選一個你正在頭疼的復雜任務試試experimental-design-prompt.md或debug-prompt.md如果有效回來點個 ?或者分享你的使用案例這不是又一個 prompt 倉庫。這是一套讓 LLM 學會像科研人員一樣思考的工作流。https://github.com/Ghost-Silver/Agentic-Method