
天貓請AI虛擬人段宴拍廣告這件事這兩天在內容圈里討論度很高。真正有意思的不是“AI頂流”這個新包裝而是消息擴散后最先反應的群體居然是配音演員。一個廣告代言為什么先觸動的是聲音行業因為大眾對AI虛擬人的預期已經變了不再關心它像不像真人而是關心它會不會直接替代某些工作。這個話題很容易被情緒帶偏。我更建議把整條產業鏈拆開看一遍虛擬人怎么被做出來、聲音從哪里來、配音演員在擔心什么、品牌方到底在賭什么。這篇就按這個順序寫也會把我在AI內容生產里遇到過的邊界問題一并放進來。1. 一場廣告代言為什么先急的是配音演員1.1 先看清這件事的結構先把這個事件拆開看。它是一個典型的AI虛擬人商業落地案例平臺方是天貓代言對象是一個叫段宴的AI虛擬人落地場景是廣告拍攝。廣告行業用虛擬偶像早就不是新鮮事初音未來、虛擬主播、虛擬KOL都是前例。但這次能被討論起來有幾個不一樣的地方。第一這是主流電商平臺直接下場讓AI虛擬人承擔“頂流”角色。平臺想把它當作可以長期運營的商業資產而不是一次性的技術演示。第二大眾注意力集中在配音演員的焦慮上說明話題已經從“技術能不能做”過渡到“做了之后誰受影響”。第三這個案例的鏈路足夠長角色形象、聲音、視頻、投放、商業變現每一環都有從業者會關心的問題。所以這篇不是在給“AI會不會取代配音演員”下結論。我更想說的是在這個事件里哪些是真實存在的變量哪些只是被情緒放大的想象。如果你只在熱搜上看熱鬧很容易得出“AI已經全面搶工作”的結論如果你真的上手做過AI內容生產就會知道中間還有大量工程細節需要處理。1.2 為什么率先被看到的是聲音而不是臉虛擬人的“臉”是數字生成的從一開始就不存在真人形象權問題。真人演員看到虛擬人更多是“多了一個競爭對手”而不是“我的臉被用了”。但聲音不一樣。虛擬人雖然沒有真實身體卻必須有一個聲音而好的AI合成音聽起來幾乎和真人沒有區別。對大眾來說看到一張CG臉不會立刻產生“我可能失業了”的感覺但聽到一段接近真人的AI配音會直接聯想到“這個工作我可能做不了”。這就是配音演員反應強烈的原因聲音的接近度把替代感變得非常具體。還有一個更現實的原因聲音的生產成本很低。一個成熟的AI聲音合成系統只需要一段授權錄音就能生成可用音色后續每生成一條語音的成本趨近于零。而廣告拍攝、3D渲染、視頻后期這些環節仍然有設備、渲染、人力等固定成本。內容行業里最先被AI滲透的通常是“邊際成本最低”的環節配音正好具備這個特征。1.3 先別急著站隊問題比“取代”復雜我看到網上不少討論直接把這件事當成“AI開始搶工作”的信號。但如果你真的做過AI內容生產就會知道“能生成聲音”和“能穩定交付廣告級成片”之間隔著一大段工程距離。虛擬人廣告要落地至少要解決三件事角色形象能不能在多個鏡頭里保持一致語音情緒能不能匹配品牌調性以及整條片子的質量能不能達到投放標準。這三件事每一項都需要人工參與和多次迭代。所以更準確的說法是AI并沒有直接“取代”誰而是把一個原本需要多人協作的流程壓縮成一個人加一套工具就能啟動的流程。省下來的不是“人”而是“溝通和等待的時間”。這個判斷后面幾個章節會展開講。2. 從“畫一張臉”到“拍一條成片”AI虛擬人廣告的生產鏈路2.1 角色設計最難的不是好看而是穩定AI虛擬人的第一步是定形象。現在用AI繪畫工具生成一張好看的臉并不難難的是讓這張臉在三十秒廣告的每一個鏡頭里都長得一樣。發型、臉型、衣服、光線、角度稍微一偏觀眾立刻會覺得“這不是同一個人”。我的建議是先做角色設定集。用一段描述詞生成正面、側面、半身、全身、不同光線下的參考圖選出最穩定的幾張作為統一基準。之后每個鏡頭都圍繞同一基準來生成而不是每張圖單獨描述。生成時盡量固定隨機種子和模型版本否則同一句話在不同版本下會跑出完全不同的臉。如果你要做3D虛擬人還需要建模、綁定骨骼、驅動表情。這條路對設備要求高流程長但好處是動作可控適合廣告里需要固定走位和產品展示的場景。如果你只是做短視頻和營銷圖2D生成路線更輕先用低分辨率驗證分鏡確認導演意圖后再出高清圖能省掉大量無效渲染。2.2 聲音生成配音演員的焦慮點就在這里虛擬人定完形象接下來就是聲音。這也是配音演員最敏感的環節。目前的AI語音生成主要有兩條路線。一條是標準TTS也就是把文案輸入大模型選擇預設音色直接輸出語音。適合產品介紹、電商口播、短視頻旁白這類標準化內容。調參重點包括語速、音調、停頓和情緒標記。不同模型情緒標記的寫法不一樣有的用標簽有的用標點控制落地前一定要先看模型的說明文檔。另一條是聲音克隆。這里必須強調克隆一個人的聲音前必須取得本人明確授權并且合同里要寫明使用范圍。合法合規的做法是讓配音演員錄制一批專用語料明確這筆錄音用于AI聲音模型的訓練再約定AI生成內容的歸屬和收益。千萬不要在未經授權的情況下使用網上扒下來的音頻做訓練數據這條線一旦突破項目再漂亮也會變成侵權事故。交付質量上廣告級成片對音頻有硬性要求。采樣率建議不低于44.1kHz響度要符合投放平臺的統一標準。如果AI直接輸出的聲音忽大忽小合成前就要先做響度歸一化而不是推到后期去補救。這里最容易踩的坑是聽感上覺得“還行”但在手機外放和專業設備上一對比齒音、氣息、低頻完全不同所以驗收時一定要換至少兩種設備試聽。2.3 視頻合成從生成片段到控制分鏡形象和聲音都定了接下來是把它們合成到視頻里。大體上分兩條路線。一條是端到端的AI視頻生成輸入腳本和參考圖直接輸出動態片段。這類工具現在做“氛圍感鏡頭”很好用比如產品在光影中旋轉、人物背影走在街道上。但它的缺點是分鏡控制弱很難讓角色在指定時間做出指定動作廣告里需要精準展示產品的場景就不太適合。另一條是虛擬人驅動方案用真人演員的動作捕捉或者面部捕捉去驅動3D角色。可控性強角色可以說指定臺詞、做指定動作適合商業廣告。缺點是制作周期長、硬件要求高。實際項目里很多團隊是兩條路線混用大場景用AI視頻生成產品特寫和人物對話用驅動方案最后在剪輯軟件里統一合成。不要一上來就出4K全片。正確的流程是先做低分辨率草稿把所有分鏡的節奏、字幕、旁白、產品位置定下來確認導演和品牌方都滿意后再進入最終渲染。一條30秒的廣告分鏡往往有幾十個如果每個鏡頭都在4K下反復重渲靠一臺機器根本做不完必須按鏡頭編號分批渲染并保留每個鏡頭的版本記錄。2.4 本地部署和云工具怎么選工具選擇上要看項目對隱私和數據安全的要求。涉及未公開新品、品牌素材或者真實人物授權的語音數據建議優先考慮本地部署方案數據不出內網風險更可控。本地跑AI模型先看硬件條件。通常來說顯存8G左右可以跑中等規模的生成模型16G以上跑大模型會更從容要是顯存不夠就得靠模型量化、降低分辨率、分批任務來湊。這里給的是通用判斷具體要以你手里的模型和機器為準。部署前還要確認Python、CUDA、模型依賴庫的版本很多啟動失敗不是模型問題而是依賴版本沖突。如果只是做一次營銷活動或者團隊里沒有專門做部署的人云端工具更省心。按量付費、界面化操作適合快速出片。缺點是數據要經過第三方授權鏈路和隱私條款要看仔細。另外不管本地還是云端都要保留生成過程的日志和參數記錄。以后一旦出現授權爭議這些記錄就是最直接的證據。3. 配音演員在擔心什么不是“聲音沒了”是定價體系被重排3.1 聲音使用權合同里最容易被忽略的部分配音演員的焦慮表面上是“AI會模仿我的聲音”本質上是“聲音的使用規則沒有跟上技術”。傳統配音的合作方式很簡單一個項目簽一份合同約定時長、用途、費用。甲方用完即止演員的聲音只出現在合同規定的作品里。AI出現后情況變了。如果配音演員在不知情的情況下自己的聲音被用于訓練模型那這個模型可以無限次生成近似自己音色的內容覆蓋到廣告、短劇、直播甚至不了解的領域。這不是“搶單”問題而是“人格聲音”的授權邊界問題。所以現在行業里比較一致的呼吁是來源授權必須前置。使用真人聲音做AI訓練必須單獨簽一份AI授權協議明確三點語料來源、訓練后的模型歸屬、生成內容的使用范圍。范圍要寫具體不能只寫“用于AI相關項目”要落到平臺、地區、期限、是否可商用、是否可再授權。3.2 哪些配音工作最先被替代哪些反而更值錢講完風險再講一個更實際的問題配音行業內部也會分化。標準化程度越高的內容越容易被AI替代。電商短視頻口播、產品功能介紹、游戲NPC的固定臺詞、智能語音提示這些內容重復度高、情緒跨度小AI語音已經能穩定覆蓋。在這些細分領域甲方的考量會越來越偏向“成本低、出片快”真人配音的份額可能被壓縮。但另一端反而會更值錢需要角色塑造的影視劇配音、需要即興反應的綜藝和直播、需要方言和年齡跨度表現的有聲書、需要臨場調整情緒的商業大片這些高度依賴人味和判斷力的工作AI暫時還接不住。我個人的判斷標準很簡單如果一個配音項目甲方能給出通稿文案要求“照著念就行”那它大概率會被AI分走一部分如果項目需要配音演員參與創作比如改臺詞、調情緒、設計角色性格那這個工作的價值反而上升。配音演員真正要守的不是“讀稿子”的環節而是“怎么讀、為什么這么讀”的創作環節。3.3 為什么AI配音聽著還行卻經不起長時間考驗很多人在短視頻里聽AI配音覺得已經跟真人差不多了。但廣告和影視里的配音跟短視頻旁白不是一個量級。短視頻旁白往往只有幾十秒情緒單一AI處理起來很輕松。但一條3分鐘的廣告、一集20分鐘的短劇、一部有聲書需要在長時間里保持穩定的角色感、呼吸節奏和情緒遞進。AI語音在長時間任務里容易出現幾個問題語句之間的情緒斷層、重音位置不合理、句子一長就開始“念課文”。這些問題第一次聽不明顯多聽幾遍就露餡。遇到這種情況排查順序是先看文本斷句和標點再看情緒標簽參數然后換一個更合適的聲音模型最后檢查是不是采樣率和響度被二次壓縮導致失真。大部分“AI配音不自然”的問題不是模型能力不夠而是前期的文案標注和參數沒有按廣告級標準走。4. 品牌方和內容團隊要用AI虛擬人先把這幾個問題處理好4.1 先判斷品牌適不適合虛擬人品牌方看到“AI頂流”案例第一反應可能是“這個風口我也要追”。但虛擬人不是萬能的先做一道篩選。如果你的品牌核心是“真實、親切、有煙火氣”比如生活服務、社區平臺、線下門店一個AI虛擬人可能反而帶來距離感。如果你的內容更新頻率很高比如每天要出幾十條電商短視頻虛擬人的生產成本優勢就會非常明顯。如果你的產品需要展示復雜細節虛擬人反而不如真人演示直觀。還有一個現實維度成本結構。虛擬人初期要投入角色設計、聲音授權、模型部署和成片流程搭建這些不便宜。但如果內容量大、更新頻次高固定資產攤薄后單條成本會低于持續雇人。算賬的時候別只看“能不能做”要看“做了多少條之后能回本”。如果連30條都做不滿那這個虛擬人大概率是虧的。4.2 合同和授權必須寫清楚的條目這是整個項目里最不能省的部分。AI虛擬人涉及至少三方品牌方、虛擬人IP運營方、聲音和形象素材的授權方。三方之間如果沒有清晰的合同條款一旦開始投放任何一方想調整使用范圍都會變成扯皮。授權事項建議寫清楚的內容為什么必須寫形象授權虛擬人形象是否可以二次修改、是否可以跨平臺使用防止形象被改動后偏離品牌定位聲音授權用于AI訓練的語料來源、訓練后模型歸屬、生成內容的使用范圍防止聲音被用到合同之外的項目使用期限授權期限、續約條件、到期后存量內容如何處理防止合作結束后素材仍在持續使用區域和平臺投放國家或地區、媒體平臺列表防止跨區域跨平臺使用引發糾紛收益分配虛擬人商業收益的分成方式、結算周期防止合作關系因利益結構不明而破裂責任承擔AI生成內容侵權時由哪一方負責處理防止出事后互相推諉審計權是否允許授權方檢查使用日志和生成記錄防止超范圍使用這些條款看起來瑣碎但任何一個遺漏在項目跑起來后都可能變成成本。合同不是用來約束合作的是用來在合作出現分歧時快速確定邊界的。4.3 加一道人工審核不要讓AI直接發布無論AI生成的廣告素材多接近完美都建議在發布前保留一道人工審核。審核的重點不是“這個片子好不好看”而是三個問題內容是否合規、產品信息是否準確、品牌口吻是否一致。AI生成內容容易出現看似合理但實際錯誤的細節比如產品參數念錯、專有名詞張冠李戴、廣告語在特定語境下產生歧義。這些錯誤在生成階段很難發現只有人帶著品牌語境去審才能攔住。另外還要保留一條回滾機制。如果某條AI生成的廣告投放后出現負面反饋要能快速定位是哪一批參數、哪一次生成、哪一個環節出了問題而不是把整條片子重做。我見過不少團隊把“AI快速出片”做成了“AI快速出事故”根源就是沒有記錄生成過程出了事只能全部推翻重來。5. 回到事件本身AI虛擬人廣告不是終點而是分工重組5.1 產業鏈上的角色會怎么變AI虛擬人廣告這個事最值得關注的不是某一條廣告本身而是它代表的產業分工變化。過去品牌方請代言人買的是“人”的知名度和形象使用權。現在品牌方做一個虛擬IP買的是一套“資產”形象資產、聲音資產、內容生產能力。這個區別很關鍵。真人代言人有自己的檔期、團隊和輿論風險虛擬IP作為一個長期數字資產可以被持續開發、分授權、跨場景使用。品牌方從“租人”變成“養資產”整個商業邏輯不一樣了。對內容工作者來說這意味著工作方式也在變。以前一個廣告項目需要對接導演、攝影、演員、配音、剪輯、調色現在很多環節被壓縮成“AI生成 人工審核 導演把關”。AI Agent在中間扮演流程調度者的角色把腳本、配音、畫面、字幕、審核串聯起來。這不是崗位消失而是崗位形態變化原來負責單點執行的人可能要變成會操作AI工具、能判斷輸出質量、能處理授權問題的復合角色。5.2 給三類從業者的落地建議第一給配音演員。不必急著把AI當成敵人但要開始管理自己的聲音資產。錄制樣音時注意保留版權聲明簽合同時把AI訓練授權單獨拎