
你好我是 Grant Liu獨立開發者關注 AI 應用與效率工具。這篇文章是我用 Seed Evolving 做 AI 出題工具的真實測評所有數據都來自實際運行結果。先認識一下這個模型有人可能還不知道它。Seed-Evolving豆包的一張「模型卡片」永遠在更新。它面向 Coding 與 Agent 場景多模態輸入文本/圖片/視頻、深度思考、GUI Agent、視覺理解能做復雜任務編排、長程規劃、代碼生成和工具調用。一個 Model IDdoubao-seed-evolving到底升級自動生效不用管版本。8 月 3 日它做了第二次升級方向很明確Coding復雜倉庫修復、跨文件修改、真實功能開發、長程任務執行更穩定Agent信息檢索、缺失信息召回、搜索結果整合更好多工具并行調用更穩幻覺搜索幻覺、工具調用幻覺、抗誤導、狀態幻覺都明顯改善接入也不麻煩。我直接買了火山的Agent Plan訂閱來測一個訂閱包覆蓋了 Seed 系列加 GLM、MiniMax、DeepSeek、Kimi 這些國內主流模型可按需自由切換也可以開 Auto 模式讓系統自動調度。文章里的所有實測都是在這個訂閱下跑的。官方介紹寫得很滿。但深度測評不能只信官方于是我給自己出了道題怎么才能真的測出這三條到底行不行。從怎么測想到教育場景一開始沒什么好辦法。跑分榜單是別人測的參數對比是紙面的我要的是真實場景里的真實表現。后來想明白一個邏輯讀取文檔然后根據文檔找資料。這是 Agent 最常見的干活方式也是最容易露餡的方式。順著這個思路我想到一個項目EXAM-FORGE本地優先的 AI 出題工具。完整流程長這樣導入教材 PDF → 四級目錄提取 Chroma 向量索引Agent 檢索 → 按題型/難度配比生成數學試卷Coding 工程 → 三層驗證 失敗自動修復幻覺控制 → 輸出學生版/教師版/驗證報告選教育場景不是隨手挑的。做之前我在 GitHub 上翻了一圈AI 出題器不算少隔三差五就有人發一個新的Hacker News 上也時不時能看到同類項目。大家都在做說明這個需求是真的。但翻下來有個發現都在做生成沒有一家做驗證。AI 出題最大的問題從來不是出不出得來而是出的題答案敢不敢信。網上甚至有人專門發帖問如何保障 AI 生成試卷的內容準確性。所以我想做點不一樣的讓 AI 出題然后讓代碼驗證它。AI 出題是幻覺控制最難的一類考場。為什么難具體來說數學沒有差不多答案對就是對、錯就是錯幻覺零容忍編錯題是模型的舒適區編一道看起來對的錯題恰恰是它最擅長的幻覺能量化對錯能用代碼驗證SymPy 符號等價幻覺第一次有了能測量的數字跑分測不出幻覺。把模型扔進教育場景錯一題就是誤人子弟。這里是幻覺最容易現形的地方。認識一下 EXAM-FORGE講測評之前先讓你知道我在測什么。EXAM-FORGE 是一個本地優先的 AI 出題鍛造器。導入本地教材 PDF它自己學習目錄和內容按需生成數學試卷并且用沙箱執行驗證代碼加 SymPy 符號校驗給每道題一個可信的答案驗證。三種使用方式方式命令適用場景Web UI默認exam-forge教材管理、可視化出題、試卷預覽與歷史終端 TUIexam-forge tui純命令行環境的圖形化操作命令行 CLIexam-forge generate ...腳本化、批量出題核心流程添加教材(PDF) → 學習教材(解析/分塊/索引/目錄) → 選擇范圍與配比 → 生成并驗證 → 預覽/下載/歷史它主要做這幾件事教材可以來自本地路徑、HTTP 鏈接、GitHub 倉庫簡寫或網頁上傳。進來之后 PyMuPDF 抽文本按章/節/段落切塊并帶頁碼建 Chroma 本地向量索引再做四級目錄提取。出題時支持計算/填空/選擇/開放四種題型open 應用題基礎/中等/提高三檔難度easy/medium/hard配比自動歸一化。生成后走三層驗證錯題帶精確錯誤信息回傳模型自動修復最多修 3 次。每次生成留一個唯一 ID 入庫隨時切換、預覽、刪除。教材、解析、索引、歷史全在本機不上傳任何第三方服務。這個工具把模型出題這個高幻覺動作和代碼驗證這個零容忍動作綁在一起天生就是幻覺控制的壓力測試場。怎么測先定四條規矩深度測評最怕憑感覺。我先給自己定了四條規矩選場景、設驗證、定指標、建工程一條都不能少。選場景AI 出題幻覺高發又能量化設驗證三層驗證沙箱執行、SymPy 符號等價、LLM-as-judge、RAG 溯源定指標一次通過率、修復輪次、狀態標簽分布、置信度吻合率建工程71 項自動化測試兜底跑分看上限這個看底線。實測一幻覺控制看試卷的真實記錄先看三層驗證是怎么搭的① 沙箱執行AST 攔截危險調用 CPU/內存限制 SymPy 符號等價 → 答案對不對代碼跑一遍就知道 ② LLM-as-judge開放題/證明題邏輯評審 → 標注置信度不假裝已驗證 ③ RAG 教材溯源章節/印刷頁碼 → 每個知識點都能回到教材第幾頁實際生成的試卷驗證報告長這樣真實產物我最想說的是第 1 題那個嘗試 2 次。第一次生成的驗證代碼跑出來和答案對不上它帶著精確的錯誤信息回傳模型自動修復后第二次通過。這就是失敗自動修復循環最多重試 3 次每次把stderr原樣回傳。開放題它也守規矩。邏輯評審通過就標已檢查待復核“不承諾 100% 正確驗證沒通過就標?”不刪題、不掩蓋。幻覺控制的真相不是模型自覺是工程強制驗證。實測二Coding 工程看生成過程的全記錄從零搭這個工具的過程就是 Coding 工程能力最誠實的展示。我挑了生成過程里幾段最典型的片段。先說開發工具。這次 Vibe Coding 用的是Trae Work先切到 Work 模式讓它輸出方案分析報告對本地優先的 AI 出題鍛造器從產品定位、技術架構、驗證閉環、資源依賴、市場格局與落地路徑六個維度做獨立評審識別關鍵風險并給出可執行的修訂建議。方案定了再切到 Code 模式開始開發。有意思的是這個工具不是一次成型是被用出來的。最開始只是個命令行 CLI用了幾次發現不方便。我就在對話里提了一句能不能做成類似 opencode 那種終端界面的工具Trae Work 直接給了方案于是有了 TUI 版本。到這里工具已經有 CLI 和 TUI 兩種用法了。但 TUI 用著用著問題又來了界面不夠美觀數學公式渲染也不對。那就繼續提需求最終迭代成了現在的 Web UI教材庫、出題參數、試卷預覽一個頁面全搞定。從 CLI 到 TUI 再到 Web UI三輪演進沒有一次是我把代碼寫好了讓它改全是它根據我的使用反饋自己迭代。這大概就是 Coding 工程能力在真實項目里的樣子。還有一件讓我印象深的事。開發到后期我讓它整體復查一遍自己的代碼它真的找出了問題章節目錄提取在某些教材上會失敗數學公式在特定寫法下渲染錯亂。它先是定位根因然后給出修復方案改完再回歸驗證。全程不需要我告訴它哪里有問題它自己把代碼從頭到尾過了一遍把坑填了。項目落地的時候71 項 pytest 測試全部通過是這個過程最后的質量證明。實測三Agent 檢索教材變成知識庫出題不能瞎出得從教材里來。這部分考驗 Agent 檢索四級目錄提取Markdown 標題、PDF 書簽、LLM 解析目錄頁、文本啟發式層層兜底Chroma 本地向量索引教材內容切塊建索引按章節或關鍵詞范圍檢索RAG 溯源每個知識點都能回到教材的章節和印刷頁碼PDF 頁碼和印刷頁碼的偏移還能自動估算換算它記得每個知識點來自教材哪一章哪一頁頁碼還能自動換算。Agent 檢索的實戰形態大概就是這樣。量化匯總能力指標結果幻覺控制出題一次通過率2 份試卷全部 ?10 題卷全過修復循環錯誤回傳自動修復最多 3 次誠實標注○/△/? 不掩蓋Coding 工程測試通過率71/71100%產品規模20 個模塊 / 三端界面自我審計復查自己代碼修復目錄提取與公式渲染 BugAgent 檢索目錄提取四級策略兜底RAG 溯源知識點 → 章節/印刷頁碼結論幻覺控制的終極形態不是模型自覺是工程強制驗證。我不信 AI 說的話我信代碼跑出來的結果。這套思路可以復制到任何AI 輸出必須可信的場景合同審核、醫療建議、財務數據。給 AI 的每個結論配一個驗證器比相信它這次不會錯可靠得多。8 月 3 日的升級不是虛的幻覺控制確實改善了。但真正讓我放心的是驗證閉環本身。而且這個思路越來越重要。最近 Agent 相關的工具迭代明顯變快Claude Code 開始默認自動模式各種 Agent 瀏覽器、自動化 Agent 陸續出來。當 AI 從聊天變成干活輸出的可信度就不再是加分項而是底線。誰先把驗證做進流程里誰就先拿到這張入場券。結尾項目已開源github.com/chnjames/exam-forge本地安裝即可用pipinstall-e.exportARK_API_KEY*** exam-forge# 啟動 Web UI也可在界面里操作# 命令行批量出題先添加教材再學習再生成exam-forge libraryadd./教材.pdf--title七年級數學exam-forge learn1exam-forge generate1-n10--scope第一章 有理數家長、老師本地教材定制化試卷答案可驗證開發者三層驗證加沙箱安全是AI 輸出必須可信的參考實現Agent 玩家檢索、生成、驗證、修復是一條可復用的流水線這套測評方法本身也可復用任何AI 生成但必須可信的場景都能用場景選擇 驗證設計 指標量化這個框架。