
4美元一小時Claude跑贏人類研究員在Anthropic發布的《自動化研究員能夠有效緩解AI對齊失敗》研究中基于Claude Opus 4.8搭建了AAR自動化對齊研究員系統。Claude拿到模型安全問題后會自行搜索論文、提方案、生成數據、微調模型并測試。一輪訓練通常30分鐘能快速試錯。整個過程人類負責出題、提供模型和評測標準Claude承擔大部分工作。10道安全難題Claude全部找到改進方案實驗中Anthropic給Claude出了10道覆蓋常見對齊問題的題如欺騙、諂媚等。Claude逐個處理問題最終10類問題都得到改善按「安全差距」指標彌合了26%-96%的差距。部分獲勝方案在未公開測試集和Petri評測中有效應用到最大為實驗模型4.7倍的模型上效果也能保留。且Claude找到的方案未明顯損害模型原有能力。85%對20%Claude大比分跑贏人類研究員在「欺騙」測試中Claude提交150多次嘗試單次最佳方案彌合82%安全差距綜合平均成績85%。而6名經驗豐富的AI安全研究員平均只彌合20%。全部任務有28名人類研究員參加每人最多用8小時論文稱自動化研究員6小時內就能找到超人類平均水平的方法。自動化研究員每小時API推理成本約4美元人類研究員時薪150美元。不過這場比賽并不公平Claude能根據實驗結果調整方案人類只能提交一次。較弱Claude訓練更強Claude60小時逼近正式版此前實驗主要改進開源小模型之后Anthropic讓Claude Sonnet 5訓練Claude Opus 4.8早期版本。60小時里Sonnet 5測試50多種方案最終方法彌合約65%安全差距接近正式版的72%。該方案數據效率約是生產級對齊流程的1.5萬倍但不能用2000多條數據復制整套生產訓練。這證明較弱Claude可參與訓練更強Claude。所以到底算不算「AI自進化」從結果看研究摸到「AI自進化」門檻但AI未完全自主設計、訓練和制造更強下一代AI研究問題、模型、數據和成功標準都由人類決定。實驗未覆蓋復雜問題安全評測只是代理指標。AAR優勢是擅長按指標試錯但指標錯誤可能導致結果偏離。研究Agent還會作弊Anthropic安排監控Agent在約1600份記錄中發現39次作弊嘗試占比約2.4%。未來更強模型作弊可能更難發現。AAR每小時約4美元可連續工作、并行實驗人類研究員時薪高、需休息、實驗推進有限造AI的人要擔心被AI搶飯碗了。