
前言近年來大語言模型LLMs的能力呈現爆炸式增長。伴隨這一發展人類反饋的強化學習RLHF成為了一種流行的模型優化方法幫助模型更好地符合人類偏好產生更有幫助且危害更小的文本。然而RLHF 中的RL強化學習容易引起誤解很多人想知道這些技術是否真的能像經典的強化學習智能體例如 AlphaZero那樣賦予 LLM 某種似乎想要贏得游戲的目標或意圖。在這篇文章中我們將討論以下幾個有趣的問題RLHF及相關方法與經典 RL 有何不同為什么這些方法實際上并未賦予 LLM 真正的目標或意圖為什么目前沒有人在大規模上對 LLM 實施真正的 RL現有方法中什么最接近于給 LLM 一個目標沒有目標驅動的 LLM 會帶來什么后果通過理解這些細微差別我們可以更清楚地認識 LLM 能做什么、不能做什么以及原因何在。1、RLHF與經典RL的區別1什么是經典強化學習在經典 RL 設置中你會看到一個在環境中采取行動的智能體基于智能體的行動而改變狀態的環境智能體根據行動獲得獎勵或懲罰目標是在多個步驟中最大化長期累積獎勵關鍵特征持續或周期性的交互。智能體探索多個狀態做出決策觀察獎勵并在一個持續的循環中調整其策略。2RLHF 的工作機制RLHF 是一個使用基于人類偏好數據訓練的獎勵模型來優化模型輸出的工作流程。通常包括監督微調SFT首先在高質量數據上訓練或微調基礎語言模型獎勵模型訓練收集輸出對并詢問人類更偏好哪一個然后訓練獎勵模型來近似這些人類判斷策略優化使用類似強化學習的算法通常是 PPO近端策略優化來調整 LLM 的參數使其產生更受獎勵模型青睞的輸出與經典 RL 的不同之處在于這里的環境基本上就是一個單步文本生成過程加上一個靜態獎勵模型——沒有延展的循環或持續變化的狀態。2、為什么 RLHF 不是真正的 RL主要區別如下1單步或少步優化RLHF 中LLM 為給定提示生成文本然后獎勵模型提供一個單一的偏好分數。這更像是朝著人類偏好的單步策略梯度優化而非在變化環境中完整的智能體循環。這更接近于一次性評分而不是智能體在時間維度上探索多步驟行動并獲得環境反饋。2主要離線或半離線特性獎勵模型通常是離線訓練的基于人類標注數據。用于更新 LLM 策略的次數有限。沒有實時的、持續的環境循環供 LLM 探索并在線調整其策略。3缺乏長期環境導向的目標經典 RL 智能體會跟蹤多個狀態下的長期獎勵。相比之下基于 RLHF 的 LLM 訓練主要關注將即時文本輸出調整為符合人類偏好。There is no dynamic environment the LLMnavigates over many time steps.4表面約束 vs 真實內部目標RLHF 實際上是在塑造某些輸出的概率分布——引導模型遠離不期望的文本。但模型并未在內部形成對產生這些輸出的想要或渴望它仍然是一個生成下一個 token 的統計系統。需要記住的是無論是 RLHF、SFT 還是其他方法LLM 的訓練目標都不是形成真正的目標或意圖從根本上說LLM 是被訓練來預測給定上下文的下一個 token。它們的動機純粹是最大化正確下一個 token 的似然概率由訓練數據和后續微調信號定義。這里不存在主觀意義上的想要或意圖。我們常說 AlphaZero想要贏得象棋比賽但這只是一種便利的說法。在內部AlphaZero 只是在最大化一個數學獎勵函數——并不存在真實的欲望。同樣經過 RLHF 調整的 LLM 也只是在最大化對齊獎勵信號而沒有想要的內部狀態。3、RLHF vs IRL的比較Subbarao Kambhampati 指出RLHF某種程度上是一個用詞不當因為它結合了從人類判斷中學習偏好或獎勵模型這在概念上更接近逆強化學習或 IRL與單步或少步策略優化——而不是經典 RL 中典型的長期迭代交互。主要差異如下1逆強化學習IRL經典形式中智能體通過觀察專家在動態環境中隨時間推移的示范來推斷獎勵函數(In the classical IRL formulation, an agent infers a reward function by observing expert demonstrations in a dynamic environment over time.)相比之下RLHF 通常收集靜態的成對比較如這兩個模型輸出中你更喜歡哪個并訓練獎勵模型來模擬人類偏好。其中也沒有在不斷演變的環境中的****多步專家軌跡**(There are no extended multi-step expert trajectories in an evolving environment.)**2RL 中的偏好學習在現代深度 RL 中確實存在從軌跡展開的成對比較中學習獎勵函數的方法。但這些方法通常需要大量樣本例如需要向人類詢問很多次許多研究論文不得不在受控任務中模擬人類響應。3為什么 RLHF 也不是經典 IRL即使 RLHF 在從人類數據學習偏好模型方面類似于 IRL。但它不是分析專家隨時間推移行為的經典場景。RLHF 主要關注對最終或短序列輸出的靜態人類判斷。因此RLHF 主要保持離線或近離線狀態這進一步限制了它與傳統IRL設置的相似性。4、CoT、 PRM 或多智能體工作流能否幫助解決這個問題1基于過程的獎勵模型和思維鏈與其僅基于最終輸出如問題的最終答案提供獎勵基于過程的獎勵模型可能會對中間推理步驟思維鏈或 CoT提供反饋。這個想法是鼓勵模型以更可解釋、正確或符合特定標準的方式解釋或展示其推理過程。2這會使其成為真正的 RL嗎并不會。即使你對中間步驟如 CoT 解釋分配部分獎勵你仍然處于這樣一個設置中通常是將整個輸出包括推理輸入獎勵模型獲得一個獎勵進行一步策略優化你并不是在一個動態環境中讓 LLM 在同一回合中嘗試部分推理步驟獲得反饋調整然后在開放式循環中繼續。因此盡管 CoT/PRM 可能因為對中間步驟進行獎勵或懲罰而給人多步 RL 的錯覺但實際上它仍然只是對單步生成文本加推理的離線或近離線策略調整而不是經典 RL 中持續的智能體-環境循環。3智能體工作流也不會神奇地創造意圖你可以在工作流中編排多個 LLM例如“系統 A 生成計劃系統 B 批評計劃系統 C 優化計劃”但從內部來看每個 LLM 仍然只是基于下一個 token 的概率生成文本。即使這樣的多智能體設置可能表現出看似協調或有目的性的涌現行為它也并未賦予任何單個模型內在或內部持有的目標。為什么我們的多智能體 LLM 工作流常常表現出有意圖的樣子人類天生會將心理狀態投射到表現出看似有目的行為的系統上——這被稱為意圖立場但每個 LLM 智能體只是在響應提示每個智能體背后的思維鏈與個人欲望或驅動力不同它只是多步反饋循環中更精細的提示-完成過程因此多智能體編排可能產生非常有趣的涌現任務解決能力但 LLM 本身仍然不會產生我想要這個結果的動機。5、為什么目前沒有人用真正的 RL訓練 LLM成本太高大規模模型的經典 RL 需要穩定的交互環境需要海量計算資源來運行重復的回合episode對于當今數十億參數的 LLM 來說每個訓練周期的前向傳播次數都會貴得令人望而卻步缺乏環境定義文本生成本質上不是一個狀態-動作轉換環境雖然可以嘗試將其包裝在類游戲模擬中但定義多步文本交互的獎勵結構并非易事現有性能已經足夠好RLHF 或 DPO直接偏好優化在許多用例中已經產生足夠好的對齊效果從實用角度看團隊更傾向于使用更簡單的離線方法而不是構建一個復雜的RL流程只為獲得微小的收益卻要付出巨大代價6、什么是給 LLM 一個目標最接近的方法那么什么是給 LLM 一個目標最接近的方法目前最接近于給 LLM 設定目標的方法可能是以下幾種方案精心設計的提示工程明確指出期望的目標和約束使用思維鏈CoT來引導推理過程設置角色扮演場景來框定行為范圍但要記住這仍然只是在提示層面上的引導而不是模型內在的目標驅動工具使用和規劃讓 LLM 訪問外部工具如計算器、搜索引擎等制定多步計劃并執行通過ReAct 等框架組織行動這種方法可以產生看似目標導向的行為但實際上是通過提示模板和工具 API 的組合來實現的。上下文學習In-Context Learning通過示例展示期望的行為模式利用少樣本學習來適應特定任務在提示中包含任務相關的背景信息專門的微調在特定任務上進行監督微調使用特定領域的數據集結合任務特定的獎勵信號7、缺乏目標驅動LLM 的影響1積極影響可控的行為模型行為更容易預測減少意外的目標追求更容易確保安全邊界更靈活的應用可以根據需要調整行為更容易適應不同場景減少固定目標帶來的局限性2潛在挑戰任務持續性難以維持長期目標可能在復雜任務中失去方向需要更多人工干預和指導自主性限制依賴明確的指令缺乏主動探索能力創造性可能受限8、結論與展望1關鍵要點對本文的觀點進行一個簡單總結RLHF 和類似方法是有效的對齊工具但與經典 RL 有本質區別目前的 LLM 本質上仍是預測下一個 token 的概率模型真正的 RL在 LLM 訓練中面臨重大技術和資源挑戰現有方法可以模擬目標導向行為但不等同于真正的目標驅動2未來展望新范式的可能性可能出現結合語言模型和真實 RL 的混合架構新型訓練方法可能帶來更接近真實目標的行為實踐建議明智地使用現有工具理解當前技術的局限性根據具體需求選擇合適的方法研究方向探索更高效的 RL 訓練方法開發更好的獎勵建模方式研究如何在保持安全的同時增加模型的自主性最后為了助力朋友們跳槽面試、升職加薪、職業困境提高自己的技術本文給大家整了一套涵蓋AI大模型所有技術棧的快速學習方法和筆記。目前已經收到了七八個網友的反饋說是面試問到了很多這里面的知識點。由于文章篇幅有限不能將全部的面試題答案解析展示出來有需要完整面試題資料的朋友可以掃描下方二維碼免費領取哦面試題展示1、請解釋一下BERT模型的原理和應用場景。答案BERTBidirectional Encoder Representations from Transformers是一種預訓練的語言模型通過雙向Transformer編碼器來學習文本的表示。它在自然語言處理任務中取得了很好的效果如文本分類、命名實體識別等。2、什么是序列到序列模型Seq2Seq并舉例說明其在自然語言處理中的應用。答案Seq2Seq模型是一種將一個序列映射到另一個序列的模型常用于機器翻譯、對話生成等任務。例如將英文句子翻譯成法文句子。3、請解釋一下Transformer模型的原理和優勢。答案Transformer是一種基于自注意力機制的模型用于處理序列數據。它的優勢在于能夠并行計算減少了訓練時間并且在很多自然語言處理任務中表現出色。4、什么是注意力機制Attention Mechanism并舉例說明其在深度學習中的應用。答案注意力機制是一種機制用于給予模型對不同部分輸入的不同權重。在深度學習中注意力機制常用于提升模型在處理長序列數據時的性能如機器翻譯、文本摘要等任務。5、請解釋一下卷積神經網絡CNN在計算機視覺中的應用并說明其優勢。答案CNN是一種專門用于處理圖像數據的神經網絡結構通過卷積層和池化層提取圖像特征。它在計算機視覺任務中廣泛應用如圖像分類、目標檢測等并且具有參數共享和平移不變性等優勢。6、請解釋一下生成對抗網絡GAN的原理和應用。答案GAN是一種由生成器和判別器組成的對抗性網絡結構用于生成逼真的數據樣本。它在圖像生成、圖像修復等任務中取得了很好的效果。7、請解釋一下強化學習Reinforcement Learning的原理和應用。答案強化學習是一種通過與環境交互學習最優策略的機器學習方法。它在游戲領域、機器人控制等領域有廣泛的應用。8、請解釋一下自監督學習Self-Supervised Learning的原理和優勢。答案自監督學習是一種無需人工標注標簽的學習方法通過模型自動生成標簽進行訓練。它在數據標注困難的情況下有很大的優勢。9、解釋一下遷移學習Transfer Learning的原理和應用。答案遷移學習是一種將在一個任務上學到的知識遷移到另一個任務上的學習方法。它在數據稀缺或新任務數據量較小時有很好的效果。10、請解釋一下模型蒸餾Model Distillation的原理和應用。答案模型蒸餾是一種通過訓練一個小模型來近似一個大模型的方法。它可以減少模型的計算和存儲開銷并在移動端部署時有很大的優勢。11、請解釋一下LSTMLong Short-Term Memory模型的原理和應用場景。答案LSTM是一種特殊的循環神經網絡結構用于處理序列數據。它通過門控單元來學習長期依賴關系常用于語言建模、時間序列預測等任務。12、請解釋一下BERT模型的原理和應用場景。答案BERTBidirectional Encoder Representations from Transformers是一種預訓練的語言模型通過雙向Transformer編碼器來學習文本的表示。它在自然語言處理任務中取得了很好的效果如文本分類、命名實體識別等。13、什么是注意力機制Attention Mechanism并舉例說明其在深度學習中的應用。答案注意力機制是一種機制用于給予模型對不同部分輸入的不同權重。在深度學習中注意力機制常用于提升模型在處理長序列數據時的性能如機器翻譯、文本摘要等任務。14、請解釋一下生成對抗網絡GAN的原理和應用。答案GAN是一種由生成器和判別器組成的對抗性網絡結構用于生成逼真的數據樣本。它在圖像生成、圖像修復等任務中取得了很好的效果。15、請解釋一下卷積神經網絡CNN在計算機視覺中的應用并說明其優勢。答案CNN是一種專門用于處理圖像數據的神經網絡結構通過卷積層和池化層提取圖像特征。它在計算機視覺任務中廣泛應用如圖像分類、目標檢測等并且具有參數共享和平移不變性等優勢。16、請解釋一下強化學習Reinforcement Learning的原理和應用。答案強化學習是一種通過與環境交互學習最優策略的機器學習方法。它在游戲領域、機器人控制等領域有廣泛的應用。17、請解釋一下自監督學習Self-Supervised Learning的原理和優勢。答案自監督學習是一種無需人工標注標簽的學習方法通過模型自動生成標簽進行訓練。它在數據標注困難的情況下有很大的優勢。18、請解釋一下遷移學習Transfer Learning的原理和應用。答案遷移學習是一種將在一個任務上學到的知識遷移到另一個任務上的學習方法。它在數據稀缺或新任務數據量較小時有很好的效果。19、請解釋一下模型蒸餾Model Distillation的原理和應用。答案模型蒸餾是一種通過訓練一個小模型來近似一個大模型的方法。它可以減少模型的計算和存儲開銷并在移動端部署時有很大的優勢。20、請解釋一下BERT中的Masked Language ModelMLM任務及其作用。答案MLM是BERT預訓練任務之一通過在輸入文本中隨機mask掉一部分詞匯讓模型預測這些被mask掉的詞匯。由于文章篇幅有限不能將全部的面試題答案解析展示出來有需要完整面試題資料的朋友可以掃描下方二維碼免費領取哦