
中國機器人的AstraTennis時刻中國機器人的AstraTennis時刻來了。8月22日第二屆世界人形機器人運動會開幕中央廣播電視總臺面向全球直播。當鏡頭掃過賽場全場的呼吸仿佛都停滯了。球網兩側一邊是人類網球名將另一邊是一臺人形機器人。這一刻標志著中國技術創新迎來足以載入史冊的具身智能奇點。全球第一場真正意義上的人機網球對戰正式開打世界首次人機對戰網球賽一上來就是精彩的人機混合網球雙打。令人意外的是銀河星仔的表現非常精彩它步法矯健根據需要迅速前后移動打得十分流暢。而且星仔和人類搭檔非常默契地形成了一前一后的站位全力應戰對面的對手。接下來由網球名將鄭潔和銀河通用機器人開展了全世界第一次人機對戰的網球單打比賽。無論是正拍還是反拍機器人都和人類打得有來有回。然后鄭潔決定上點難度打出一個月亮球。結果在被對手左右調動的過程中機器人不小心摔了個四腳到底。出乎意料的是下一秒它居然立刻調整姿勢站了起來。而面對鄭潔的切削和旋轉機器人的判斷居然也很不錯。終于鄭潔知道不能放水了開始左右前后分點調動機器人出人意料地完成一個精彩的跨步贏得現場喝彩。比賽結束機器人的表現讓所有人歡呼。整場比賽里屈膝、拋球、轉體這些動作全都由人形機器人自己完成。而且發球時速達到一百多公里留給它的反應時間只有零點幾秒它卻幾乎沒有掉鏈子。這臺機器人正是來自銀河通用。十年前AlphaGo贏了李世石。十年后國產機器人與網壇頂尖運動員同臺競技。如果說AlphaGo證明AI能征服數字世界那么今天銀河通用的國產機器人證明AI能扛住物理世界的極限壓力測試。它第一次從代碼里站了起來在真實的對抗中奔跑、揮拍、博弈甚至摔倒后自己爬起繼續戰斗。如此精彩的具身智能AstraTennis時刻被全球同時見證中國機器人的AstraTennis時刻為什么這場網球賽能引起全球科技圈的巨大地震因為網球是對具身智能極致的壓力測試。由于反應時間只有零點幾秒這項運動同時將機器人的感知、決策、全身運動控制和實時博弈能力逼到了物理極限。而且打網球比下圍棋對AI來說難得多。畢竟AlphaGo面對的是19路網格上361個確定的交叉點對手落子后它有幾十秒甚至幾分鐘來推演下一步。那是數字世界的博弈解空間雖大但邊界清晰規則恒定。整個世界是靜態的、離散的AI對此一覽無余。雖然這道題的解空間比宇宙原子數還多但對AI而言這也不過是道難度更大的「數學題」。但網球場不一樣。球以每小時一百多公里的速度過來落點受旋轉、風、場地摩擦影響每一拍的物理參數都不重復。機器人必須在幾百毫秒內完成感知、預測、決策、全身協調同時保持自己不摔倒。對手是打活人會騙機器人還會變節奏。這就是莫拉維克悖論的現場版。1988年卡內基—梅隆大學移動機器人實驗室主任漢斯·莫拉維克就指出過「讓計算機在智力測驗或下跳棋時表現出成人水平的表現相對容易但要賦予它們一歲兒童在感知和行動方面的技能則困難甚至不可能。」三十多年過去前半句早已兌現但后半句卻很難實現。所以這次網球賽真正的意義要遠遠大于「機器人會不會打球」。它問的是這一次AI究竟能不能從數字世界走出來把感知、決策、運動控制和實時博弈在真實物理環境里閉環跑通AI不能止步于思考而是要完成從認知決策到全身執行的完整閉環。這一次中國企業率先交卷了賽場上銀河通用機器人的表現實在令人驚艷。發球、正手、反手、底線調動、網前截擊這些單項能力在比賽里全部出現了而且全都是超常發揮。而雙打考驗就更大了。機器人和人類隊友同場要實時判斷誰去接這個球、誰補位動態調整打法和。所以它要理解的不只是球還有隊友下一步想干什么。高速攻防里還出現了極限救球的場面。摔倒之后機器人自己站起來繼續打。很多人第一反應是這些單項動作之前機器人不是做到了嗎投籃、踢球、跑百米過去兩年人形機器人的視頻里似乎什么都有。但其中最大的差別在于網球是兩個玩家在對抗。跑步的環境是確定的網球的每一拍都是對手臨時出的新題。跑步可以一個動作練一萬遍網球沒有兩個完全一樣的來球。能在對抗中站住才是真正的智能。大腦和小腦第一次裝在同一個模型里背后支撐這一切的是銀河通用自研的具身智能大模型「銀河星腦」AstraBrain。它最大的亮點之一就在于架構選擇。過去行業里的主流做法是分層一個「大腦」模型負責理解任務、做高層決策一個「小腦」模塊負責實時運動控制兩者之間用接口傳遞指令。這種架構的弊端也很直接大腦想得再清楚傳到小腦已經慢了半拍小腦動作再標準不知道大腦為什么要它這么動。更隱蔽的問題是信息斷層。大腦下指令的時候不知道此刻自己的重心壓在哪條腿上、右臂還有多少發力余量小腦執行動作的時候不知道這一拍是想調動對手還是想直接得分。兩邊各自最優合起來卻是一個「想得到做不到」或者「做得到想不到」的系統。在打網球這種任務上稍微慢半拍結果就是輸球。銀河星腦的做法是把大腦層任務理解與戰術決策、小腦層高動態全身運動控制和神經控制集成在同一個模型里。按銀河通用的說法這是全球首個模型能同時負責「想清楚」和「做出來」中間不再有信息損耗。從網球這個任務倒推這可能是唯一的解法。戰術決策離不開對自己身體極限的實時感知運動控制也離不開對戰術意圖的理解兩者本來就不該分家。從不完美的人類數據里學在虛擬球場里對打一千萬次架構之外的另一個問題是這個模型怎么練出來的機器人領域的一個傳統難題就是——沒有數據。語言模型可以吃掉整個互聯網的文本機器人沒有這樣的互聯網。真機采一小時動作數據要一小時還要人盯著還會摔壞硬件。這也是為什么過去幾年具身智能的進展總是慢于大家的預期。這背后離不開銀河通用核心技術平臺「銀河星坊」 的支撐。接下來分兩個步驟。第一步是從「不完美人類數據」里學。人類打網球的動作數據可以采動作捕捉、視頻、穿戴傳感器都行。但人類的動作本身不標準業余選手的確很業余有多余動作。而職業選手的動作最大化個人運動素質別人做不來而且每個人的身高臂展關節角度都跟機器人對不上。傳統模仿學習要求示范數據干凈、對齊、高質量這種要求在人類數據上幾乎不可能滿足。銀河星坊數據平臺要做的就是從這堆帶噪聲、不對齊、良莠不齊的示范里提煉出有用的先驗什么時候該啟動揮拍的大致節奏身體重心怎么轉移真正學會其中的運動規律。這一步的價值在于冷啟動。機器人不用從隨機亂動開始摸索它一上來就大概知道「打網球長什么樣」。第二部就是進虛擬網球世界。在仿真環境里多個智能體互相對打。不是一個機器人對著發球機練而是若干個策略各自演化、互為對手。一方學會了壓邊線另一方就被迫學會橫向大范圍移動一方學會了放小球另一方就被迫學會快速上網。在這海量的虛擬博弈中奇跡發生了——「技能涌現」。工程師沒有教過它怎么滑步救球但在無數次沒接到球的失敗后模型自己「領悟」了極限伸展的姿態。工程師沒有寫下倒地后起身的硬代碼但在虛擬世界摔了千萬次后模型自己「學會」了如何調動全身電機重新站立。技能無需手工設計出在對抗壓力下AI學會自學。最后當這些在虛擬世界中練就神功的「靈魂」被無損遷移到物理世界的真實機器人軀體中時一個網球大師就此誕生放在整個機器學習的譜系里這條路走在兩個極端中間。純模仿學習的天花板是示范者的水平人類教練教不出超過自己的學生而且人類示范里根本沒有「摔倒后怎么爬起來繼續打」這種數據。純強化學習從零開始探索在網球這種動作空間巨大、獎勵稀疏的任務上搜索成本高到不現實而且容易學出一些人類完全看不懂的怪異動作能贏球但不像打球。先用人類先驗打底再用自主進化拔高。這本身不算新AlphaGo當年也是先學人類棋譜再自我對弈。新的地方在于十年前這套方法在棋盤上跑通十年后它第一次在需要身體的任務上跑通。某種意義上這正是AstraTennis與AlphaGo之間最迷人的技術呼應。AlphaGo的時代智能在棋盤上思考而這一次智能開始進入物理世界。這絕不僅是一場網球賽。這個AstraTennis時刻證明在碳基與硅基共生的新紀元里中國力量開始創造更多奇跡。原文鏈接剛剛全球首場人機網球賽開戰機器人極限救球讓鄭潔看呆了-36氪