
2026年7月27日OSWorld榜首易主歸中國團隊。中國芯智能體“實在Agent”以90.2%的成功率登頂。歷史最高分首個突破90%大關的智能體。實在Agent同時拿下總榜第一與Agentic Framework分榜第一實現雙冠。刷新了海外巨頭Meta、Anthropic、OpenAI等保持的公開最高紀錄。標題01 OSWorldAI的“計算機駕駛執照考試”OSWorld是目前全球公認的“Computer-Use Agent”權威基準由香港大學、卡內基梅隆大學、滑鐵盧大學等機構于2024年發表于人工智能頂級會議NeurIPS。核心定位是讓AI智能體在真實的操作系統中像人類一樣通過鼠標、鍵盤、屏幕截圖等接口完成跨應用的復雜任務。與僅限網頁或API調用的傳統基準如WebArena、MiniWoB等不同OSWorld提供的是完整的真實桌面沙盒環境。OSWorld基準測試包含361個由專家精心設計的實戰任務涵蓋辦公、編程、UI設計及系統管理等高頻場景。智能體是否完成任務均由機器判定沒有任何人工評價的主觀偏差這也是OSWorld成為權威評測基準的主要原因之一。各大廠在發布旗艦模型時幾乎都會引用OSWorld成績。例如OpenAI發布GPT-5.4時強調“首次超越人類”Google發布Gemini 3.6 Flash時強調“83%全場最高分”Anthropic發布Claude Sonnet 5時強調“81.2%”。回顧OSWorld過往最好成績這條曲線見證了整個行業的發展● 2024年OSWorld剛發布GPT-4o、Claude-3.5-Sonnet等當時最強智能體的成功率僅12.2%● 2025年5月UI-Evol增強智能體達到22.0%● 2025年12月Simular Agent S2達到72.6%首次超過72.36%的人類基線● 2026年5月Pointer達到83.6%再創新高● 2026年7月實在Agent達到90.2%登頂OSWorld雙榜。兩年時間從12%到83%這條曲線已經非常陡峭。而實在Agent的90.2%——在頂端再躍一步標志著Computer-Use Agent正式邁入“超高可靠性”的新階段。標題02 三個數字看懂實在Agent的統治力在OSWorld全部361個硬核實戰課題中實在Agent最終拿下了325.59分總成功率 90.2%。拆解細分領域得分實在Agent呈現出一種“多點領先、核心場景大幅領先”的格局常用辦公與編程場景● 表格與文檔Calc/WriterLibreOffice Calc拿下46.0/47Writer拿下22.0/23● 編程與多媒體VS Code/VLCVS Code拿下22.0/23VLC播放器拿下16.89/17● 演示與郵件Impress/ThunderbirdImpress演示文稿拿下42.96/47Thunderbird郵件處理拿下13.0/15。在這些日常高頻場景中實在Agent保持著高完成度與穩定領先奠定了扎實的技術基本盤。核心難點場景在這之外真正讓我們在榜單上拉開差距的是OSWorld中公認最難、最考驗智能體硬實力的三個“地獄級”場景● 跨應用協同multi_apps78.81/93這是任務量最大、最易出錯的場景93個任務。實在Agent獲得78.81分領先第二名近10個百分點。它模擬的是真實辦公中最繁瑣的跨系統流程Chrome下載文件 → LibreOffice編輯數據 → 截圖存檔 → Thunderbird發送郵件。這種需要連續穿梭四五個軟件的長鏈路任務展現了實在Agent卓越的長鏈路規劃能力?!?圖像處理gimp24.0/26GIMP界面充滿了浮動面板、非標準工具欄和像素級微操堪稱視覺AI的噩夢。在26個任務中實在Agent拿下24個成功率92.3%證明了我們在非標準界面視覺理解上的深厚積累?!?系統底層操作os24.0/24 100%滿分在文件權限修改、進程管理、命令行操作等“錯一步即全盤皆輸”的任務中我們實現了零失誤反映了底層執行閉環極高的穩定性。跨應用領先長鏈路規劃力。GIMP領先非標準界面理解力。系統滿分執行閉環可靠性。三項能力疊加構成了實在Agent在OSWorld上的整體優勢。標題03 登頂的背后是“八年磨一劍”智能體領域有一個行業共識Agent Model Harness。模型Model是發動機提供通用智力和原始動力Harness工程套件/整車架構則是方向盤、變速箱、剎車與安全系統是把智力轉化為“可靠行駛”的完整工程體系。為什么Harness如此關鍵在Stanford、清華等機構的論文中有一個研究證明在同一個底層模型的前提下僅改進Harness工程設計在OSWorld等基準上的性能差距可達6-10個百分點而在某些復雜任務上將原生代碼Harness優化為自然語言與范式結合的Harness同一模型的得分甚至能從30.4%躍升至47.2%差距接近17個百分點這說明當模型能力逐漸同質化Harness工程化才是決定智能體“能不能真干活”的核心變量。但Harness的可靠性從來不是某一次技術突破的偶然而是長期的企業場景沉淀、操作數據積累和工程化迭代的必然。實在智能做智能體有一個“第一性原理”——你不能干的我能不能干誰的能力邊界更廣誰的成本更低、效率更高面對真實的操作環境API能跑通就跑APIAPI跑不通就用GUI——像人一樣看屏幕、點鼠標把數據拿回來把事辦成。這套“多模態”的Harness能力是實在智能從2018年成立第一天起就在打磨的基本功。此外作為自動化領域的行業領頭羊實在智能已服務了超6000家企業客戶90%為世界500強、央國企、上市企業和地方龍頭。這意味著實在智能已在客戶側積累了海量真實桌面環境的操作數據、異常處理機制和行業流程模板。這些場景和數據正是Harness工程迭代最寶貴的原材料。因此實在Agent能拿下90.2%不是單一模型參數的勝利而是八年深耕自動化領域的行業Know-how、海量真實業務數據以及Harness工程體系三者疊加的必然結果。標題04 從基準高分走向生產力真正落地OSWorld榜單的登頂是技術演進的重要里程碑但它絕不是終點。如果說OSWorld是智能體考取“計算機駕照”的考場那么真正的考驗在于能否駛入復雜、多變的企業真實生產環境。從“榜單高分”到“產業落地”實在Agent的突破正指向智能體演進的下半場從90.2%到工業級99.99%的可靠性跨越在真實企業的財務、HR或供應鏈場景中哪怕9.8%的失敗率也可能引發重大業務風險如發錯郵件、錯填付款金額。實在Agent在自主執行的基礎上構建人機協同與安全斷路器機制——在涉及高風險、敏感數據的操作時自動提權確認提供“操作撤銷與回滾”能力不斷將工業級可靠性推向99.99%??绮僮飨到y與復雜動態環境的抗干擾能力OSWorld建立了優秀的Ubuntu虛擬機基準而工業界真實的辦公環境充滿了軟件版本更新、隨機廣告彈窗、系統通知抖動、網絡延遲卡頓等非標準干擾因素。智能體的落地價值在于即使界面樣式微調、彈窗突然打斷也能像人類員工一樣靈活應對、自主糾錯??伤阗~的商業ROI與全鏈路安全合規通過端側輕量模型與云端VLM的混合調度實在Agent在降低Token推理成本與響應延遲上持續優化讓智能體的運行成本遠低于人力成本。同時打造符合企業級安全標準的沙盒隔離環境與全鏈路可審計日志確保智能體每一次點擊、輸入都可追溯、可歸因、可合規。OSWorld的90.2%不僅代表著中國團隊在智能體工程賽道上的斷層領先更宣告了AI正在擺脫“只會聊天”的對話框形態真正接管屏幕成為能夠驅動復雜軟件系統、創造實際經濟價值的數字勞動力。讓AI真正“會干活”從基準高分走向生產力落地——這是登頂OSWorld的核心也是實在智能八年未變堅守的底座。高原之上再建高峰。