
干安防集成這行多年從 H.264 熬到 AV1 大規模落地親眼見過每一代編碼標準出來時的行業熱鬧也踩過不少 “追新翻車” 的坑。今年 5 月 28 日 AOMedia 把 AV2 v1.0.0 規范正式定稿6 月初官方官宣之后同行群和朋友圈直接炸了好多開發商、集成商上來就問碼率省 30%是不是下個月就能把項目全換成 AV2 降成本說實話我第一反應不是興奮是心里咯噔一下 —— 得又得挨個跟客戶解釋 “為啥不能明天就全量切換” 了。先給大伙交個底AOMedia 官方的說法是同畫質下 AV2 比 AV1 省約 30% 的碼率屏幕內容、HDR、8K 這類特定場景能接近 40%Netflix 的工程師 Norkin 放出的實測數據PSNR-YUV 下 BD-rate 改善約 28.7%VMAF 下約 32.6%和官方口徑基本對得上。但公道話得說在前頭獨立第三方的全場景驗證還在推進真實業務里的收益會跟著畫面場景浮動別被廠商宣傳里的 “暴降 30%” 帶跑了節奏。今天就跟同行說點實在的這 30% 到底是從流水線哪一環摳出來的落到咱們做 AIoT、做智慧安防的項目里到底是紅利還是坑架構上該怎么準備。盡量說人話不繞沒用的術語。先掰扯最容易被炒歪的一點AV2 不是 “AI 編碼器”這兩天刷到不少自媒體喊 “AV2 用上 AI 編碼了”—— 別鬧真不是這么回事。AV2 v1.0 的底層仍然是傳統混合塊編碼的老路子畫面切塊、預測、變換、量化、熵編碼、環路濾波和三十多年來所有主流編解碼器的核心框架沒區別。規范本身沒有把 AI/機器學習放進核心編碼流程里核心目的就是保證解碼器足夠輕普通消費級芯片就能跑不用額外搭 NPU。它所謂的 “數據驅動”是離線用機器學習訓練出變換核、預測矩陣這些參數把訓練好的固定結果固化到標準里。解碼的時候跑的還是經典流水線不會實時跑神經網絡。說白了是用 AI 輔助制定標準不是讓設備跑 AI 編碼這倆完全是兩碼事。當然它也適合和外部 AI 模塊搭配比如在編碼器前面掛個 AI 降噪、超分的預處理層喂給 AV2 更干凈的源畫面整體壓縮效果還能再往上提一截。但這是兩套獨立的東西別混為一談。先潑完冷水再講更現實的代價按照 VideoLAN 負責人 Jean-Baptiste Kempf 對參考軟件的實測AV2 軟件解碼的復雜度大概是 AV1 的 5 倍編碼器復雜度只會更高。眼下沒有任何量產芯片帶 AV2 硬件解碼能力行業普遍預期硬件解碼器要到 2027-2028 年才會出現在商用芯片里真正大規模普及得等到 2028 年之后。也就是說未來三五年里AV1 和 AV2 一定是長期共存的狀態這點做技術選型的心里得先有數。30% 的碼率節省到底是怎么摳出來的很多人只記住了 30% 這個數字不知道收益是散在整條編碼流水線的每一個環節里每一處改動都帶著明確的取舍。挨個拆開說都是做工程的看懂了底層邏輯才好算自己項目里的真實收益。塊劃分超級塊翻一倍大塊省比特、小塊保細節AV1 的最大超級塊是 128×128AV2 直接拉到了 256×256。做安防的都懂監控畫面里大半是天空、墻面、停車場這種大面積平滑區域用小塊切的話塊邊界多、額外開銷大換成 256×256 的大塊一整塊平滑區域可能就一個劃分開銷直接降下來。遇到文字、人臉、移動物體這種細節密集的地方再逐級往下拆成小塊。光做大塊還不行容易把解碼端的帶寬和算力拉爆。所以 AV2 加了個半解耦劃分SDP搭配好幾種非對稱劃分模式大尺寸塊里亮度和色度共享劃分策略省掉重復計算到 64×64 及以下的小塊又允許各自獨立劃分保住細節。做過邊緣設備優化的都懂這種 “編碼端使勁卷、解碼端能省則省” 的設計有多重要 —— 直接關系到邊緣網關的硬件成本不是紙面參數那么簡單。預測參考幀變多預測越準殘差越小壓縮的核心邏輯就是預測當前這塊畫面能不能用旁邊的塊、或者前面幾幀的畫面拼出來。拼得越準剩下的殘差就越小要編碼的數據就越少。幀內預測這邊AV2 用了數據驅動幀內預測DIP不是老一套的幾何角度插值而是用海量真實畫面離線訓練出投影矩陣面對墻面、純色背景這種重復單調的紋理預測精度提升很明顯。CfL 亮度推導色度也做了優化夜視低照度的 HDR 畫面適配性更好。幀間預測的改動更實在參考幀上限從 AV1 的 2 幀拉到了最多 7 幀還加了時間插值、光流運動微調、簡化多參考幀這些工具。像慢云臺、移動車輛這類畫面運動補償能貼得更準殘差進一步收縮。還有幀內塊拷貝IBC的優化對監控里反復出現的標牌、圍擋這類靜態圖案壓縮效率提升很直觀。當然代價也有編碼器的搜索空間變大了復雜度又漲了一截。但解碼端只是按語法解析不用做復雜搜索咱們做平臺、做終端的解碼側壓力不會因為預測工具變多就暴漲這點還算厚道。變換數據驅動變換是這代最核心的改動這塊我得多說兩句個人覺得這是 AV2 和以往所有編碼標準最不一樣的地方。傳統編碼用的 DCT 離散余弦變換變換核是固定的數學公式。AV2 引入了 DDT 數據驅動變換 —— 提前用 KLT 算法拿海量真實視頻的殘差數據離線訓練出多套變換核直接固化到標準里。說人話就是這個變換核是 “從真實視頻里學出來的”不是憑空推導的數學公式所以對真實場景殘差的能量集中能力比 DCT 強得多。同樣一塊殘差過一遍 DDT大部分能量都會塌縮到少數幾個低頻系數上后面量化的時候就能放心扔掉更多高頻細節又不怎么影響主觀畫質。配合 DDT 的還有兩個輔助工具IST 二次變換給低頻系數再做一次降維進一步擠掉無效信息CCTX 跨色度分量變換利用色度之間的相關性做聯合編碼。三者搭配下來殘差能量的集中程度比 AV1 高一大截這也是 30% 總收益里貢獻最大的單項技術之一。順帶提一句AV2 還把原生 64 點 DCT 給砍了換成 32 點逆變換加殘差上采樣。看著像是 “減配”實際上 256×256 大塊普及之后大尺寸變換的需求本身就在減少用極小的畫質損失換來了硬件實現難度的大幅下降 —— 標準制定的人是真懂芯片設計的難處。量化扔掉查找表用網格找最優解AV1 的量化靠好幾張查找表映射步長維護起來繁瑣。AV2 直接換成統一的指數公式做步長映射邏輯干凈了很多。真正的升級是 TCQ 網格編碼量化。它搞了 Q0、Q1 兩個子量化器重建電平錯開半個步長。編碼器用 Viterbi 動態規劃在 8 個狀態的網格里找率失真最優的路徑 —— 說白了就是把 “每個系數量化用 Q0 還是 Q1” 變成了一個最短路徑問題找全局最優解而不是逐系數單獨決策。單個系數看差別不大整幀算下來碼率和失真的平衡能做得更精細。同樣復雜度漲在編碼端解碼端只需要按語法查表重建感知不到 TCQ 的存在。熵編碼三個毫米級優化積少成多熵編碼是壓縮的最后一公里單個工具提升幅度都不大但幾個小優化疊起來對總收益的貢獻不容小覷。AV2 底層還是沿用 MS-AC 多符號算術編碼器沒換引擎只在 “怎么把數據喂給編碼器” 上做了三處微調。PARA 概率自適應率調整通過偏移參數動態調節 CDF 概率表的收斂速度監控畫面經常有場景突變、光線切換這個工具能讓概率模型更快貼合一新畫面的符號分布少浪費比特。FSC 前向跳過編碼專門針對屏幕內容。電腦屏幕、工控界面這類有大量銳利文字邊緣的畫面走頻域變換反而會打散能量AV2 干脆跳過變換直接對空間殘差做旁路編碼 —— 這也是 AV2 在屏幕內容場景能省近 40% 碼率的核心原因做指揮大廳大屏、工業 HMI 的同行可以重點關注。還有個很巧的 PH 奇偶校驗隱藏當 AC 系數不少于 4 個時編碼器微調這些系數的奇偶性讓它們和 DC 系數的符號位保持一致。解碼端只要算一下 AC 系數的奇偶就能隱式推出 DC 的屬性直接省掉一個比特的顯式信令。這三項單個可能也就貢獻 0.5%-1% 的收益但架不住多。干過編解碼優化的都懂到了 AV1 這個成熟度再想摳 30% 不可能靠某一項黑科技全是幾百個 0.1% 的優化堆出來的AV2 干的就是這個笨功夫。環路濾波統一鏈路給解碼端減負AV1 的環路濾波是多級串聯去塊、CDEF、環路恢復一路算下來模塊多邏輯雜。AV2 換成了統一的通用去塊濾波器新增 GDF 導向細節濾波器和 CCSO 跨分量采樣偏移。CCSO 用亮度信息校正色度誤差對安防常用的 4:2:0 采樣格式特別友好夜視畫面的色度噪聲能壓得更干凈。整體思路和塊劃分的設計一脈相承編碼端可以使勁堆復雜度解碼端能省就省盡量控制硬件實現的門檻。落到安防場景紅利和坑各占一半講完技術原理還是得落回咱們的老本行。AV2 對智慧社區、園區安防、高空拋物這類項目的影響得拆開四個維度看不能只盯著碼率下降瞎樂。帶寬側的利好最直觀。比如 4K 高空拋物攝像頭單路上行碼率原本 4-8Mbps幾十路同時回傳的話公網帶寬是一筆不小的固定開銷。同畫質下碼率約降 30%跨公網的帶寬成本、4G/5G 的流量成本都能明顯壓縮。但要注意這是理想場景的均值夜間低照度、車流密集的路口這類畫面實際節省會打折扣做預算別直接按 0.7 倍硬套。存儲側的收益也很實在。邊緣 NVR、云端冷存儲、取證片段歸檔的占用量都會同步收縮同樣的硬盤容量錄像留存周期能拉長一截。對有明確合規留存要求的項目成本壓力會小很多。但同樣別直接拿 30% 去做存儲規劃拿自己項目的真實樣本跑一遍實測最穩妥。最容易踩坑的是邊緣側甚至有點反直覺碼率是降了但智能分析網關的整體算力壓力反而可能漲。原因很簡單 —— 現在沒有硬件解碼全靠 CPU 軟解復雜度是 AV1 的 5 倍。如果網關既要做 AV2 解碼又要并行跑高空拋物軌跡識別、周界入侵檢測這類 AI 推理很容易出現解碼把 CPU 占滿AI 推理算力不夠、延遲飆升的情況。我當年 H.265 剛普及的時候就踩過類似的坑軟解吃滿處理器智能分析直接卡成 PPT。所以智能分析網關的硬件選型必須重新評估算力余量不能看見 “碼率降 30%” 就盲目樂觀。平臺側的改動相對可控。GB28181、RTSP 這些傳輸協議本身不用變但 AIoT 平臺的多媒體接入層、轉碼流水線、解碼庫都要做升級必須支持 AV1/AV2 雙棧兼容向下還要兼容 HEVC。畢竟未來三五年新老設備混裝是常態不可能一刀切全換成 AV2。物聯底座的價值把編碼迭代的成本收到底層編碼標準是隔幾年就迭代一次的東西如果每個項目、每代標準都從零重寫解析、轉碼、調度邏輯時間長了全是技術債。成熟的做法是把多媒體底層能力做抽象讓業務層專心做告警、做流程、做 AI 應用不用跟著編碼標準反復改底層。像美暢智能物聯中臺UCC核心定位就是設備層和業務層之間的抽象層。向下把不同廠商的設備協議做歸一把 AV1、AV2、HEVC 多格式解析、轉碼調度都封裝到底層向上輸出標準化的事件和媒體接口還能給分布式的智能分析網關統一調度媒體處理任務。開發團隊不用每一代編碼都重做一遍底層適配能省不少重復勞動。但邊界也得說清楚這類中臺能解決軟件層面的格式適配、調度管理問題解決不了芯片沒有硬解單元的硬件短板。軟解帶來的高算力消耗平臺再優化也繞不開最終還是得等芯片廠商的硬件生態跟上來。別指望買一套中臺就能抹平硬件代差那不現實。給集成商的話Codec 升級避坑指南踩了這么多代編碼的坑總結幾條落地建議都是實打實的經驗大伙當個參考。第一雙棧兼容漸進遷移別搞一刀切。未來 3-5 年 AV1 和 AV2 必然共存架構上一定要做 Codec 抽象層把編解碼模塊和業務邏輯解耦。后續不管是 AV2 迭代還是再出更新的標準改動都收攏在底層不用動業務代碼。邊緣設備的固件也要支持動態加載雙解碼庫根據碼流自動切換。第二邊緣算力賬要重新算別想當然。AV2 軟解復雜度是 AV1 的 5 倍邊緣網關如果既要解碼又要跑 AI 推理算力配比要重新評估。個人建議實時分析類的邊緣節點等 2027-2028 年硬件解碼器普及了再規模化上 AV2現階段用 AV1 過渡最穩妥。第三純存儲、純轉發的場景可以先吃紅利。比如云端冷存儲、跨機房備份這類不需要實時解碼的場景AV2 的壓縮收益可以直接兌現風險也低。這類后端存儲環節可以先遷前端實時分析環節暫緩分階段來最穩。第四別信 “AV2 立即可用” 的宣傳。規范發布不等于設備就緒不等于生態成熟。官方自己都承認第三方驗證還在進行中。咱們做落地的把它當成 2-3 年后的技術儲備就行先做 POC 驗證別急著上生產。第五做屏幕內容、工業 HMI 的團隊可以提前布局。FSC 工具對屏幕類畫面的優化是實打實的接近 40% 的碼率節省不是虛的這類場景可以早做 POC收益會比普通監控場景更明顯。寫在最后干了這么多年 codec越來越覺得每一代編碼標準的迭代從來不是什么顛覆性革命都是工程上一點點摳出來的進步。AV2 這 30% 的增益是 256×256 大塊打底DDT 主攻殘差壓縮TCQ 優化量化PARA/FSC/PH 在熵編碼里摳每一個比特再加上環路濾波給解碼端減負幾百個小優化堆出來的結果。它的長期潛力毋庸置疑免專利費的特性也讓它對商用項目很友好。但落地這件事從來不是紙面參數說了算得看芯片、固件、終端、平臺整條鏈的成熟度。對咱們做 B 端項目的人來說最理性的做法就是架構上提前留好 AV2 的位置現階段用 AV1 扛住業務等硬件解碼成熟了再逐步切換。技術是用來解決問題的不是用來追新的。真正的工程智慧從來不是選最新的標準是選最合適的標準。AV2 是未來但未來還沒到。咱們做落地的總得在前沿和務實之間給自己留一條穩妥的路。