
強化學習這兩年在業界和學術圈的熱度不用多說從游戲博弈到機器人控制再到 ChatGPT 背后的 RLHFReinforcement Learning from Human Feedback人類反饋強化學習幾乎處處都能看到它的影子。而不管算法包裝成什么樣只要深入到大模型對齊那一層就必然會碰到一個繞不開的組合Actor-Critic 算法。網上關于強化學習的資料很多但普遍存在兩個問題要么只講概念不給推導要么直接甩出一堆公式不講直覺。這篇教程會把演員-評論家算法作為主線從策略梯度為什么需要評論家講起先把 TD 誤差的數學含義拆開再一步步推導 Actor-Critic 的更新公式最后結合 RLHF 場景說明 PPO 在語言模型對齊中的落地方式并給出一份可以運行的 PyTorch 示例代碼。適合剛接觸強化學習、希望看懂 RLHF 內部原理或者準備在實際項目中使用 Actor-Critic 框架的開發者閱讀。1. 強化學習與 RLHF 的關系1.1 什么是強化學習強化學習研究的是一個智能體Agent在與環境Environment交互過程中如何通過不斷試錯來學習最優策略Policy的問題。每次交互可以拆解為智能體在當前狀態 (s) 下根據策略 (\pi(a|s)) 選擇一個動作 (a)環境返回一個即時獎勵 (r)并轉移到新狀態 (s)。如此循環智能體的目標不再是最大化某一步的獎勵而是最大化長期累積獎勵的期望。這個過程和人們常說的“監督學習”有本質區別。監督學習有明確的標準答案模型通過擬合標簽來學習輸入輸出映射而強化學習沒有標準答案只有獎勵信號。獎勵信號往往稀疏、延遲、存在噪聲這就導致算法必須解決“信用分配”問題到底哪一步動作導致了最終的高回報傳統表格型方法在狀態空間較小時可以工作一旦狀態空間連續或維度很高就必須借助函數近似例如神經網絡。深度強化學習Deep Reinforcement Learning就是“強化學習 深度神經網絡”用深度網絡來表示策略、價值函數或模型。1.2 從強化學習到 RLHFRLHF 嚴格來說并不是一種全新的強化學習算法而是一種“訓練范式”。它解決的是“如何讓模型行為符合人類偏好”的問題。以大語言模型為例普通的監督微調只能讓模型學會模仿人類給出的答案但無法真正理解“什么回答更好”。于是研究者設計了一條流程先訓練一個獎勵模型Reward Model讓它學會對人類偏好打分。再用強化學習算法去優化語言模型讓模型生成的回答獲得更高的獎勵分數。在這個流程中語言模型本身就是強化學習里的 Actor它負責生成文本獎勵模型輸出的分數就是獎勵信號。為了讓訓練穩定通常還會引入一個評論家網絡Critic來估計狀態價值或動作價值。因此 RLHF 在實現層面大量使用 Actor-Critic 框架尤其是 PPOProximal Policy Optimization算法。這也是本文把“Actor-Critic”和“RLHF”放在一起講的原因。1.3 容易混淆的概念實際閱讀資料時有幾組概念經常被混用先在這里做一次區分概念含義常見誤區Actor策略網絡輸入狀態輸出動作分布被誤認為只是“生成動作的模型”Critic價值網絡輸入狀態輸出價值估計被誤認為必須和 Actor 共享結構TD 誤差時序差分誤差用于衡量真實獎勵與估計之間的偏差被誤認為是“優勢函數”本身優勢函數某個動作相對平均水平的優勢A(s,a)Q(s,a)-V(s)被誤認為只能用 TD 誤差估計RLHF用人類反饋訓練獎勵模型再用強化學習優化策略被誤認為是一種具體算法理解這些概念后再看 Actor-Critic 推導會順暢很多。2. 策略梯度與 Actor-Critic 的動機2.1 策略梯度為什么直接用獎勵會不穩定在策略梯度方法中我們希望最大化期望累積獎勵[ J(\theta) \mathbb{E}{\tau \sim \pi\theta} [R(\tau)] ]其中 (\tau (s_0, a_0, r_0, s_1, a_1, r_1, \dots)) 是一條軌跡(R(\tau) \sum_{t0}^{T} \gamma^t r_t)。對參數 (\theta) 求梯度可以得到著名的策略梯度定理[ \nabla_\theta J(\theta) \mathbb{E}{\tau \sim \pi\theta} \left[ \sum_{t0}^{T} \nabla_\theta \log \pi_\theta(a_t|s_t) \cdot R_t \right] ]這里的 (R_t \sum_{kt}^{T} \gamma^{k-t} r_k) 是軌跡從時刻 (t) 起的累積折扣回報。這個公式看起來很簡單但直接使用存在一個問題方差極大。因為不同軌跡之間的回報差異可能非常大同一個動作在高回報軌跡和低回報軌跡中都可能出現算法難以判斷動作本身是好是壞。為了降低方差通常會給獎勵減去一個基線Baseline改成[ \nabla_\theta J(\theta) \mathbb{E} \left[ \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) \cdot \left( R_t - b(s_t) \right) \right] ]基線 (b(s_t)) 只要不依賴于動作 (a_t)就不會改變梯度的期望但能顯著降低方差。一個自然的選擇是狀態價值函數 (V^\pi(s_t))。于是策略梯度中的“回報減去基線”就變成了“動作價值減去狀態價值”也就是優勢函數 (A^\pi(s_t, a_t) Q^\pi(s_t, a_t) - V^\pi(s_t))。這正是 Actor-Critic 的思想起點。2.2 從 REINFORCE 到 Actor-CriticREINFORCE 是典型的蒙特卡洛策略梯度算法它必須等到一條軌跡結束后才能計算累積回報。這種做法的優點是估計無偏缺點是方差大、學習效率低。如果能在每個時間步都獲取一個“即時反饋”就可以更快更新。于是評論家出現了。評論家網絡負責估計價值函數例如 (V(s)) 或 (Q(s,a))。Actor 網絡負責生成策略。訓練時Actor 根據評論家提供的優勢估計更新策略評論家則根據實際觀察到的獎勵和下一狀態的價值來更新自己。兩者交替訓練這就是 Actor-Critic 框架。從 REINFORCE 到 Actor-Critic核心變化是把“采樣完整軌跡再計算回報”改成“用價值函數估計作為回報近似”。這種做法引入了偏差因為價值函數本身估計不準但換來的是方差大幅下降。在深度強化學習實踐中方差問題往往比偏差問題更致命因此 Actor-Critic 方法成為主流。2.3 為什么需要 CriticCritic 網絡承擔了“評估當前策略好壞”的任務。如果沒有 CriticActor 就只能依賴真實獎勵信號而真實獎勵通常是稀疏的。例如機械臂抓取任務只有抓到物體才給 1 獎勵其他時候都是 0這種稀疏獎勵讓策略梯度很難學習。Critic 可以通過學習狀態價值為每一步提供一個稠密的“預期收益”信號即使當前沒有真實獎勵也能通過 (r \gamma V(s) - V(s)) 給出一個更新信號。這就是時序差分Temporal DifferenceTD學習的價值。3. TD 誤差概念與公式推導3.1 TD 誤差的定義時序差分學習是強化學習中的核心思想之一。它結合了蒙特卡洛采樣和動態規劃的思想用一步真實獎勵加上下一狀態的價值估計來更新當前狀態的價值估計。TD 誤差定義為[ \delta_t r_t \gamma V(s_{t1}) - V(s_t) ]其中(r_t) 是時刻 (t) 執行動作后獲得的即時獎勵(\gamma) 是折扣因子取值范圍通常為 ([0, 1])(V(s_t)) 是當前狀態價值的估計值(V(s_{t1})) 是下一狀態價值的估計值。如果 (V) 是真實價值函數那么根據貝爾曼方程(r_t \gamma V(s_{t1})) 的期望應該等于 (V(s_t))因此 TD 誤差的期望為 0。如果估計有偏差TD 誤差就反映了這種偏差。在 Actor-Critic 中TD 誤差不僅是評論家的更新目標也可以作為動作優勢的近似估計。3.2 TD 誤差與優勢函數的關系優勢函數定義為[ A^\pi(s_t, a_t) Q^\pi(s_t, a_t) - V^\pi(s_t) ]而動作價值 (Q^\pi(s_t, a_t)) 滿足[ Q^\pi(s_t, a_t) r_t \gamma V^\pi(s_{t1}) ]將上式代入優勢函數[ A^\pi(s_t, a_t) r_t \gamma V^\pi(s_{t1}) - V^\pi(s_t) \delta_t ]因此 TD 誤差可以被看作優勢函數的一種單步采樣估計。當然實際使用中由于價值函數 (V) 是近似估計TD 誤差存在偏差但它在每一步都能計算非常適合在線學習。3.3 多步 TD 與 GAE單步 TD 雖然方差低但偏差可能較大尤其是在獎勵延遲明顯的任務中。為了平衡偏差和方差可以使用多步回報[ A^{(n)}t \sum{k0}^{n-1} \gamma^k r_{tk} \gamma^n V(s_{tn}) - V(s_t) ]更進一步GAEGeneralized Advantage Estimation廣義優勢估計通過對不同步數的 TD 誤差做指數加權平均得到更靈活的優勢估計[ A^{GAE}t \sum{l0}^{\infty} (\gamma \lambda)^l \delta_{tl} ]其中 (\lambda \in [0,1]) 控制偏差和方差的權衡。(\lambda 0) 時退化為單步 TD(\lambda 1) 時接近蒙特卡洛估計。PPO 等現代算法普遍使用 GAE就是因為它在稀疏獎勵場景下表現更好。關于 GAE 的推導本質上是把多步優勢估計按照 (\lambda) 做指數平滑這里不再展開矩陣形式但理解這個加權思路對調參很有幫助。4. Actor-Critic 算法數學推導4.1 目標函數與梯度Actor 的目標是最大化期望累積獎勵但為了引入基線我們寫成[ \nabla_\theta J(\theta) \mathbb{E}{\pi\theta} \left[ \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) A(s_t, a_t) \right] ]其中 (A(s_t, a_t)) 代替了原來的回報 (R_t)。這就是帶基線策略梯度的一般形式。在實際實現中期望用采樣近似因此 Actor 的損失函數一般取負的代理目標[ L_{actor} -\frac{1}{N} \sum_{i1}^{N} \log \pi_\theta(a_i|s_i) \cdot A_i ]如果使用 TD 誤差作為優勢估計則 (A_i) 用 (\delta_i r_i \gamma V_{\phi}(s_{i1}) - V_{\phi}(s_i)) 代替。但單步 TD 偏差較大所以實際項目中更常用 GAE 或使用評論家輸出 (V(s)) 計算多步優勢。4.2 評論家的目標函數評論家的目標是讓價值函數估計更準通常使用均方誤差MSE損失[ L_{critic} \frac{1}{N} \sum_{i1}^{N} \left( V_\phi(s_i) - \hat{R}_i \right)^2 ]其中 (\hat{R}_i) 是目標回報例如[ \hat{R}i r_i \gamma V{\phi_{target}}(s_{i1}) ]需要注意評論家網絡 (V_\phi) 如果和目標回報使用同一組參數會造成自舉偏差的累積。因此很多實現會使用一個目標網絡Target Network或延遲更新機制。在 PPO 中由于策略更新幅度被限制評論家網絡通常直接和 Actor 共享部分底層特征或完全獨立具體取決于狀態空間和動作空間的復雜度。4.3 Actor-Critic 更新算法流程一個標準的 Actor-Critic 循環可以寫成下面的偽代碼初始化 Actor 網絡 π_θ 和 Critic 網絡 V_φ for 每個回合: 初始化狀態 s for 每個時間步 t: 根據 π_θ(·|s) 采樣動作 a 執行動作 a觀察獎勵 r 和下一狀態 s 計算 TD 誤差: δ r γ V_φ(s) - V_φ(s) 存儲 (s, a, r, s, δ) 更新 Critic: φ ← φ - α_c * ?_φ (δ)^2 更新 Actor: θ ← θ α_a * ?_θ log π_θ(a|s) * δ s ← s實際深度強化學習中通常不是單步更新而是先收集一批數據再用小批量梯度更新類似于經驗回放。為什么需要批量因為單個樣本的 TD 誤差噪聲太大直接在線更新會讓網絡參數震蕩。4.4 從 Actor-Critic 到 PPOActor-Critic 框架雖然有效但直接使用策略梯度更新 Actor 時如果學習率設置不當一次更新過大策略會發生突變導致訓練崩潰。PPO 的解決方案是裁剪代理目標[ L^{CLIP}(\theta) \mathbb{E} \left[ \min\left( r_t(\theta) A_t, ; \text{clip}(r_t(\theta), 1-\epsilon, 1\epsilon) A_t \right) \right] ]其中 (r_t(\theta) \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}) 是新舊策略的比率。通過裁剪PPO 限制每次更新的幅度從而保持訓練穩定。PPO 仍然使用 Actor-Critic 結構Critic 估計狀態價值Actor 輸出策略分布。這也是 RLHF 中最常用的強化學習算法。5. RLHF 中的 Actor-Critic 應用5.1 RLHF 訓練流程拆解RLHF 的完整流程可以分成三個階段監督微調SFT先讓語言模型具備基礎對話能力。獎勵模型訓練收集人類對多個回答的排序或打分訓練一個獎勵模型用來代替人類的實時反饋。強化學習優化用 PPO 等算法以獎勵模型給出的分數作為獎勵信號更新語言模型策略。在第三個階段Actor 就是語言模型本身它的輸入是提示Prompt輸出是生成的整段文本。Critic 則是一個價值網絡輸入狀態通常是提示 已生成文本的某種嵌入到當前步為止的上下文輸出一個標量價值。因為生成階段被建模為馬爾可夫決策過程每一步生成一個 token 相當于一個動作。5.2 為什么 RLHF 要用 PPO 而不是直接策略梯度直接使用原始策略梯度在語言模型場景下有幾個問題語言模型參數規模龐大一次采樣一條完整回答成本很高逐 token 的獎勵非常稀疏只有整個回答生成完畢才能得到獎勵模型的分數如果單步更新太大模型會產生語法崩壞、重復冗余的輸出。PPO 通過重要性采樣和裁剪解決了更新幅度問題同時利用 Critic 對每個 token 的狀態價值進行估計能夠把“整段獎勵”逐 token 分解成優勢信號從而更新每一步的 token 生成策略。此外PPO 還加入 KL 散度懲罰項防止模型為了獎勵模型的高分而偏離原始 SFT 模型太遠。KL 懲罰的實際作用可以理解為“不要為了分數犧牲可讀性”。5.3 PPO 在語言模型中的損失函數完整 PPO 損失通常包含三個部分Actor 的裁剪策略目標Critic 的價值函數損失熵正則Entropy Bonus和 KL 懲罰項。可以寫成[ L^{PPO} - L^{CLIP}(\theta) c_1 L^{VF}(\phi) - c_2 \mathcal{H}[\pi_\theta] \beta \cdot \text{KL} ]其中 (L^{VF}) 是評論家價值損失(\mathcal{H}) 是策略熵KL 項衡量當前策略與參考策略一般是 SFT 模型的分布距離。實際工程中各項系數 (c_1, c_2, \beta) 都需要針對具體任務調整。一個常見問題是KL 懲罰加在獎勵上還是加在損失函數上兩種方式都存在。把 KL 懲罰加到實時獎勵上更直觀PPO 采樣時每個 token 獎勵可以設置為[ r_t^{total} r_t^{reward_model}(samples) \cdot \mathbb{I}(t T) \beta \cdot \log \frac{\pi_{\theta}(a_t|s_t)}{\pi_{ref}(a_t|s_t)} ]這里只有最后一個 token 收到獎勵模型的標量獎勵其余 token 只收到 KL 懲罰信號。但實際實現中強化學習訓練時整個序列的每個 token 位置都會計算 Critic 的價值因此需要把序列級別的獎勵映射到每一個 token 位置。這也是 RLHF 訓練代碼中最容易踩坑的地方。5.4 一個簡化的 RLHF 訓練偽代碼# 偽代碼僅用于理解流程不直接可運行 for prompt in dataset: # 1. Actor 生成回答 response actor.generate(prompt) # 2. 計算每個 token 的 logprob 和 KL log_probs actor.get_logprobs(prompt, response) ref_log_probs ref_model.get_logprobs(prompt, response) kl log_probs - ref_log_probs # 3. 獎勵模型打分整段分數 reward_score reward_model(prompt, response) # 4. 將整段獎勵分配到每個 token常見做法最后一個 token 得到獎勵 token_rewards torch.zeros_like(log_probs) token_rewards[-1] reward_score - beta * kl.mean() token_rewards[:-1] - beta * kl[:-1] # 5. 用 GAE 計算優勢 advantages gae(values, token_rewards, masks) # 6. 更新 Actor 和 Critic actor_loss clip_actor_loss(log_probs, old_log_probs, advantages) critic_loss mse_loss(values, returns) loss actor_loss critic_weight * critic_loss - entropy_weight * entropy loss.backward() optimizer.step()注意真實 RLHF 代碼會比這段復雜得多包括共享內存采樣、微批量更新、動態 KL 系數、長度歸一化獎勵等。理解流程后再去看開源實現會輕松很多。6. 最小可運行示例PyTorch 實現 Actor-Critic接下來給出一份可以直接運行的 Actor-Critic 示例代碼環境使用 OpenAI Gym 的 CartPole-v1。這個任務相對簡單不需要 GPU適合驗證算法流程。代碼核心思路是用一個共享兩層全連接網絡分別輸出策略分布參數和價值標量通過 TD 誤差更新。6.1 環境準備本示例建議使用以下環境Python 3.8 及以上PyTorch 1.13 或 2.xgymnasium 0.28 或以上注意新版已從 gym 改名為 gymnasium安裝命令pip install torch gymnasium如果你的環境已經安裝了老版本gym也可以跳過安裝但需要將代碼導入部分改為import gym。版本差異不影響算法邏輯。6.2 完整代碼# 文件路徑actor_critic_cartpole.py import torch import torch.nn as nn import torch.optim as optim import gymnasium as gym import math class ActorCritic(nn.Module): 共享底層特征的 Actor-Critic 網絡。 Actor 輸出動作概率的 logitsCritic 輸出狀態價值 V(s)。 def __init__(self, state_dim, action_dim, hidden_dim128): super(ActorCritic, self).__init__() self.fc1 nn.Linear(state_dim, hidden_dim) self.fc2 nn.Linear(hidden_dim, hidden_dim) self.actor_head nn.Linear(hidden_dim, action_dim) self.critic_head nn.Linear(hidden_dim, 1) def forward(self, state): x torch.relu(self.fc1(state)) x torch.relu(self.fc2(x)) policy_logits self.actor_head(x) value self.critic_head(x) return policy_logits, value def get_action(self, state): policy_logits, value self.forward(state) dist torch.distributions.Categorical(logitspolicy_logits) action dist.sample() log_prob dist.log_prob(action) return action.item(), log_prob, value def train(env, agent, optimizer, gamma0.99, max_steps1000): 單回合訓練采集軌跡計算 TD 誤差并更新網絡。 log_probs [] rewards [] values [] dones [] state, _ env.reset() state torch.tensor(state, dtypetorch.float32) total_reward 0 for step in range(max_steps): action, log_prob, value agent.get_action(state) next_state, reward, terminated, truncated, _ env.step(action) done terminated or truncated log_probs.append(log_prob) values.append(value) rewards.append(reward) dones.append(done) state torch.tensor(next_state, dtypetorch.float32) total_reward reward if done: break # 計算 TD 誤差和 Actor/Critic 損失 returns [] G 0.0 for i in reversed(range(len(rewards))): G rewards[i] gamma * G * (1 - dones[i]) returns.insert(0, G) returns torch.tensor(returns, dtypetorch.float32) values_tensor torch.cat(values).squeeze() log_probs_tensor torch.stack(log_probs) # Critic 損失價值估計與累計回報之間的 MSE critic_loss nn.functional.mse_loss(values_tensor, returns) # Actor 損失策略梯度的負對數似然 * 優勢用 TD 誤差近似 advantages returns - values_tensor.detach() actor_loss -(log_probs_tensor * advantages).mean() loss actor_loss critic_loss optimizer.zero_grad() loss.backward() optimizer.step() return total_reward if __name__ __main__: env gym.make(CartPole-v1) state_dim env.observation_space.shape[0] action_dim env.action_space.n agent ActorCritic(state_dim, action_dim) optimizer optim.Adam(agent.parameters(), lr1e-3) episodes 500 for episode in range(episodes): reward train(env, agent, optimizer) if (episode 1) % 20 0: print(fEpisode {episode 1}, total reward: {reward})6.3 代碼說明這段代碼雖然簡單但完整展示了 Actor-Critic 的核心流程。ActorCritic類中actor_head輸出動作分布的 logitscritic_head輸出狀態價值。get_action通過 Categorical 分布采樣動作返回動作、動作對數概率和當前狀態價值估計。訓練函數中先與環境交互收集一整條軌跡然后在軌跡結束時計算累積回報G并把累積回報作為 Critic 的回歸目標。優勢函數使用returns - values.detach()這里并沒有直接用 TD 誤差而是用蒙特卡洛回報近似優勢因為單步 TD 在 CartPole 上也可以運行但方差更大。如果你希望觀察 TD 誤差的作用可以把優勢換成rewards gamma * next_value - value注意需要額外計算下一狀態價值。運行后如果網絡正常收斂你會在 200 到 400 個回合之間看到回報穩定在 200 左右CartPole 的最大步數限制通常為 200。如果你的代碼在 100 回合內回報不升反降一般是因為學習率過大或優勢計算錯誤。6.4 擴展到 PPO 需要考慮什么上面的示例是單步更新的“原始 Actor-Critic”與 PPO 還有差距。要把它改成 PPO需要額外做幾件事保存每步的old_log_prob使用 GAE 計算優勢對 Actor 損失進行裁剪多輪小批量更新而不是每回合只更新一次增加熵正則項鼓勵探索。如果這篇文章發布后大家感興趣我可以再單獨寫一篇“從零實現 PPO”的教程把這三處改造逐一拆開。現在先把 Actor-Critic 的基礎打好。7. 常見問題與排查思路問題現象常見原因解決思路訓練一開始回報就在下降然后陷入震蕩學習率過大Actor 更新步長過大調小學習率或使用 PPO 裁剪機制回報一直很低但 Critic 損失很小Critic 已經收斂但 Actor 策略陷入局部最優增大熵正則系數或增加動作探索優勢值波動非常大梯度爆炸獎勵尺度差異過大或 GAE 中的 lambda 設置不當對獎勵做歸一化例如除以獎勵均值調整 gamma 和 lambdaRLHF 訓練中模型輸出變得重復、死板KL 懲罰過小模型過度優化獎勵模型增大 KL 懲罰系數或使用動態 KL 系數語言模型生成退化輸出無意義符號PPO 更新時熵正則系數為 0策略過早確定添加熵正則并監控 token 級別的熵多個進程采樣時動作分布不一致隨機種子未固定或模型權重不同步對齊隨機種子統一初始化權重Actor 和 Critic 共享網絡導致兩者梯度沖突兩個任務的梯度方向不一致使用雙頭網絡但底層分離或使用兩個獨立網絡訓練不穩定損失出現 NaN數值溢出通常是 log 概率為 0 或梯度爆炸給 log_prob 加 epsilon使用梯度裁剪這些坑在學術示例和實際項目中都很常見。特別是 RLHF 場景問題往往不是算法本身而是獎勵設計和 KL 約束沒有調好。建議每訓練一段時間就手動查看模型生成文本不要只盯著獎勵曲線。8. 最佳實踐與工程建議8.1 優勢函數與價值網絡的設計在 Actor-Critic 框架中Critic 的作用是為 Actor 提供低方差的學習信號。因此價值網絡的預測準確性直接影響訓練效果。建議在同一個 batch 中Critic 可以多更新幾次而 Actor 每次更新幅度不要太大。在 PPO 中Critic 通常使用與 Actor 相同的 batch 數據但損失函數權重可以獨立調節。如果 Critic 和 Actor 使用共享底層特征需要小心梯度競爭。很多成熟實現例如 Stable-Baselines3默認使用兩個獨立的 MLP或共享一個 Encoder但分開 Head。8.2 獎勵工程設計強化學習對獎勵尺度極其敏感。RLHF 中獎勵模型輸出的分數范圍可能很大直接在多個任務上使用會不穩定。一種常見做法是對獎勵做標準化z-score或者除以獎勵標準差。但也不要過度歸一化否則會損失區分度。對于語言模型還有一種有效做法是按回答長度歸一化獎勵避免模型通過生成超長文本來刷分。這是工業界總結出的寶貴經驗在學術論文中很容易被忽略。8.3 探索與利用的平衡Actor-Critic 的本質是“邊探索邊利用”策略熵正則項是控制探索能力的關鍵。熵太大會導致策略過于隨機無法收斂熵太大會導致過早收斂到局部最優。實踐中一般將熵系數設置為 0.01 到 0.001并在訓練后期線性衰減。監控每批次策略熵的平均值如果熵突然跌到 0說明策略幾乎變成了確定性策略這在許多任務中是危險的。8.4 RLHF 工程中的安全與合規RLHF 的目的是讓模型行為對齊人類偏好但“人類偏好”本身帶有主觀性必須遵守法律法規和倫理邊界。在訓練獎勵模型時要使用合法合規的數據集避免通過對抗樣本或惡意提示來“攻擊”獎勵模型。不要試圖讓模型繞過安全限制也不要讓模型在敏感領域產生虛假信息。工程上RLHF 訓練需要在受控環境中進行設置人工審核環節對于人工反饋數據要做匿名化處理并確保數據采集獲得用戶授權。8.5 代碼可持續性強化學習實驗代碼比普通訓練代碼更容易腐化。建議從一開始就把“環境配置”“采樣循環”“模型更新”拆成獨立模塊。采樣環境使用向量化環境例如gymnasium.vector可以提升訓練吞吐量。模型定義和損失函數用獨立函數封裝方便切換算法。日志系統記錄每個 step 的獎勵、價值損失、策略熵、KL 散度這能在排錯時省下大量時間。保存模型時除了權重還要保存 optimizer 狀態、隨機種子和超參數否則無法復現實驗結果。8.6 性能優化CartPole 這類小環境用單進程訓練沒問題但真實 RLHF 任務通常要并行采樣。語言模型生成文本很慢一般使用 vLLM 等推理框架加速采樣Critic 的價值網絡可以用單一的 GPU 作為獨立服務。數據傳輸建議使用共享內存隊列避免序列化開銷。在更新階段Actor 和 Critic 可以輪流更新也可以同時更新。PPO 通常采用“先收集大量樣本再多次更新”的方式因此采樣進程和訓練進程分離是必要的。如果你需要在多機環境訓練還涉及參數同步和通信開銷建議先單機多卡跑通再擴展。9. 總結與學習建議Actor-Critic 算法的價值在于它為深度強化學習和 RLHF 提供了一套穩定的訓練框架。理解了 Actor 輸出策略、Critic 輸出價值、TD 誤差充當學習信號這三者之間的關系就相當于打通了強化學習的主流脈絡。在此基礎上繼續學習 GAE、PPO、TRPO、SAC 會更快。RLHF 本質上是 Actor-Critic 在語言模型對齊中的應用核心難點并不在策略梯度本身而在于獎勵模型的質量、KL 約束的調節以及大規模分布式訓練工程。如果你想繼續深入建議按以下路線實踐先手動推導一遍策略梯度定理和 TD 誤差公式運行本文的 CartPole 示例修改優勢估計方式觀察方差變化閱讀 Stable-Baselines3 的 PPO 源碼逐行對照公式用開源 RLHF 框架如 TRL、DeepSpeed-Chat跑一個小模型查看訓練日志和生成效果。強化學習是一門“看公式覺得懂了寫代碼立刻懵”的學問但多寫幾次代碼多調幾次參數后直覺會逐漸建立起來。希望這篇教程能成為你理解 Actor-Critic 和 RLHF 的第一塊墊腳石遇到問題也歡迎在評論區討論。