
「拓展無人機自主飛行的能力邊界」目錄01 DPNet預判看不見的死胡同實現主動規避而非事后補救行業固有路線的短板02 AgilePE自博弈強化學習端到端無人機追逃對抗03 兩套系統定位、邊界與行業位置04 寫在最后浙江大學高飛團隊近期發布兩篇工作DPNet面向靜態復雜環境通過輕量網絡預判視場外的死胡同結構生成虛擬障礙屏障讓規劃器主動繞開陷阱機載50Hz高頻重規劃AgilePE面向動態對抗場景基于優先虛擬自博弈PFSP完成端到端追逃強化學習直接輸出底層總推力機體角速度指令仿真訓練完零樣本遷移真實無人機涌現出側翼包抄、側向震蕩躲閃等博弈戰術。兩篇工作分別覆蓋「環境驅動的安全導航」和「對手驅動的對抗博弈」均不依賴實機標注微調把感知預測、規劃、仿真?實機遷移完整打通代表小型自主無人機兩套不同的技術演進路線。01 DPNet預判看不見的死胡同實現主動規避而非事后補救行業固有路線的短板傳統應對死胡同的方案分為兩類但都屬于事后反應式處理一類是被困之后執行后退、旋轉等恢復機動飛行軌跡被打斷任務連續性被破壞另一類維護高精度全局拓撲地圖尋找備選路徑但建圖計算開銷巨大還會累積位姿漂移不適合算力有限的微型無人機。圖| DPNet解決的問題有限局部感知下的死胡同失效問題也有部分工作學習預測未知區域占據、前沿邊界但大多目標是稠密重建探索計算開銷高不會專門針對死胡同這種凹形危險結構做定向處理。死胡同不需要完整重建整個未知空間只需要拿到三件極簡信息死胡同是否存在、相對距離、方位角就足夠約束規劃器。DPNet 沿著任務導向最小預測這個思路不做全場景重建只聚焦死胡同 hazard 預測。論文在貢獻聲明中明確寫道據我們所知這是首個針對視覺無人機導航顯式處理主動死胡同規避的工作。整套系統由三部分構成雙分支死胡同預測網絡、虛擬障礙屏障生成、死胡同感知的軌跡庫碰撞檢測。1雙分支輕量預測網絡RGB分支、深度分支兩套編碼器分別提取語義特征和幾何結構特征特征拼接融合之后分兩個輸出頭掩碼頭輸出二值掩碼標記死胡同像素區域深度頭回歸對應區域距離逐像素相乘之后只保留死胡同區域的有效深度。網絡訓練完全依靠仿真自動標注數據集不需要人工打標簽。算法依據內角點、外角點的可見幾何規則自動生成真值掩碼區分“可推斷”和“歧義不可推斷”樣本規避標簽噪聲。RGB編碼器復用DINOv3預訓練權重并凍結權重只微調深度分支這一非對稱微調策略是實現sim?zero?shot的關鍵防止網絡過擬合仿真紋理。圖| DPNet系統整體框架總覽2虛擬障礙屏障生成網絡輸出的死胡同像素投影到三維空間取最小預測深度構建平行于圖像平面的平面虛擬障礙再通過MLS點云上采樣生成致密點云和原始深度點云融合成統一的局部障礙物點云。這個虛擬屏障并不是真實物理物體是給規劃器的“警示墻”阻止軌跡駛入死胡同入口。3死胡同感知的軌跡篩選與重進入抑制DPNet基于預計算運動基元軌跡庫做碰撞檢測融合虛擬障礙后的點云做碰撞校驗把所有會撞上虛擬屏障的軌跡直接剪枝。這里存在一個特殊工程問題無人機飛過去之后死胡同離開視場虛擬屏障消失貪心規劃器會又選一條折返沖回死胡同的軌跡。論文新增平滑一致性代價項懲罰航向角突變抑制“二次闖入”陷阱。圖| 普通碰撞檢測與死胡同感知碰撞檢測對比仿真設置簡單分為簡單、困難兩個等級對比EGO?Planner、Primitive?Planner、Faster三套主流本地規劃器。簡單場景DPNet成功率100%困難場景依然保持99%成功率對比基線Faster平均飛行時間縮短25%左右。基線方案要么撞毀要么觸發后退恢復機動飛行距離和耗時顯著增加。機載Jetson Orin NX完整流水線穩定50Hz運行網絡推理僅9.2ms點云后處理2.4ms軌跡規劃5.1ms完全滿足微型無人機高速導航實時約束。圖| 有限局部感知條件下的算法基準對比真實室內實驗表明DPNet可以區分真正死胡同和中間存在可通行缺口的“形似死胡同”不會錯誤設置虛擬屏障允許無人機正常穿過開口通道。圖| 真實世界導航實驗02 AgilePE自博弈強化學習端到端無人機追逃對抗如果說DPNet要對抗的是靜態環境陷阱AgilePE要面對的是會主動博弈的智能對手。追逃對抗是零和博弈追蹤方需要把目標保持在機載視錐內并且縮短距離逃逸方要飛出對方視場拉大戰術距離。傳統方案的痛點微分博弈HJI方程高自由度四旋翼動力學下面臨維度爆炸很難用于真實敏捷機動MPC模型預測控制極度依賴對手運動的精準預測對手戰術變化則性能暴跌現有強化學習追逃大多輸出航路點、速度這類中間指令受中間規劃層限制無法釋放無人機全部機動能力樸素自博弈訓練存在嚴重策略震蕩、災難性遺忘對抗策略不斷循環無法沉淀穩健戰術仿真到真機鴻溝推力延遲、機體速率滯后、傳感器噪聲仿真訓練策略經常真機直接失控。AgilePE完整框架分為三塊端到端敏捷控制子系統、雙邊對抗訓練子系統、硬件對齊仿真部署子系統。圖| AgilePE整體框架包含三大子系統1端到端CTBR底層指令輸出策略網絡直接把觀測映射到底層控制指令總推力三軸機體角速度CTBR拋棄航路點、中間軌跡規劃模塊神經網絡可以直接調用飛行器完整機動包絡。獎勵函數綜合追蹤博弈目標、超速懲罰、邊界懲罰、防撞懲罰、指令平滑項。平滑獎勵是真機零樣本部署的關鍵抑制高頻抖動指令。圖| 1v1無人機追逃博弈任務定義2層級化對抗自博弈訓練Naive?SP → FSP → PFSP論文對比了三級自博弈訓練范式樸素自博弈Naive?SP最新追蹤者和最新逃逸者互相對抗。缺點非平穩環境訓練后期容易出現策略單邊崩塌逃逸方學不出有效防御戰術。FSP虛擬自博弈維護歷史對手策略池訓練的時候均勻采樣歷史對手緩解震蕩但采樣沒有區分對手難度。PFSP優先虛擬自博弈本文核心創新采樣概率和歷史對抗失敗率掛鉤訓練優先選擇最難對付的歷史對手相當于自動課程學習加速高級戰術涌現同時保留歷史策略池防止災難性遺忘。圖| FSP與PFSP的交叉評估收益矩陣交叉評估收益PFSP訓練出來的追蹤者對全部歷史版本逃逸者保持82%以上視場內捕獲率會自發涌現dash?and?flank側翼包抄、距離管控、側向震蕩躲閃這類人類可理解的博弈戰術。權衡優先采樣困難對手會帶來戰術特化面對簡單腳本對手性能會輕微下降但對演化對抗對手魯棒性大幅提升。3硬件對齊仿真?實機遷移管線不使用普通物理引擎接觸求解器采用RK4四階積分直接積分機體位姿顯式建模推力45ms延遲、機體角速度30ms延遲疊加推力、機體速率乘性噪聲大量域隨機化質量、氣動、延遲參數讓策略在訓練階段就適應硬件帶來的非理想特性做到零樣本遷移真機不需要微調。真實飛行動捕環境下部署在Jetson Orin NX策略推理運行60Hz復現仿真里的包抄、側向躲閃戰術。圖| 真實追逃實驗長曝光光軌圖紅藍分別代表追蹤機、逃逸機軌跡03 兩套系統定位、邊界與行業位置在整個微型無人機自主智能的技術譜系上DPNet屬于感知?預測?規劃路線的延伸不去做完整稠密重建堅持“任務導向最小預測”給傳統本地規劃增加預判能力兼容現有運動基元規劃棧工程落地門檻相對低。它解決的是傳統局部規劃“近視”問題規劃器只能看到眼前幾米DPNet幫它“多看一眼拐角后面的危險”但是只針對凹形死胡同這一類特定危險結構。AgilePE屬于端到端強化學習對抗智能路線繞開傳統規劃、微分博弈讓戰術機動從對抗交互中涌現代價是當前依賴完整狀態觀測如果要完全脫離動捕后續需要接入視覺感知模塊。兩篇工作共同的亮點訓練全部可以在仿真完成真機不需要重新采集數據和微調這對于小型無人機非常關鍵——真機高速機動實驗炸機風險高硬件損耗成本昂貴。04 寫在最后DPNet和AgilePE代表小型自主無人機兩個重要的技術方向一個面向環境帶來的危險用輕量感知預測彌補傳感器視場的局限性改良傳統規劃系統追求安全可靠的A?B點導航另一個面向對手帶來的博弈用對抗強化學習挖掘飛行器機動極限讓無人機學會復雜戰術對抗。兩者都貫徹了“仿真大規模生成數據真機零樣本部署”的思路降低高風險真機試飛的依賴。但也留下共同的待解命題把兩套能力融合——在充滿障礙物的真實物理世界無人機既要預判環境死胡同又要和動態對手開展博弈這也是未來空中具身智能值得探索的方向。參考文獻1、DPNet: Efficient Dead?End Prediction and Avoidance for Vision?Based UAV Navigation (arXiv:2608.16640)2、AgilePE: Autonomous UAV Pursuit?Evasion via Self?Play Reinforcement Learning (arXiv:2608.14135)