
Inverse Scaling Prize數據發布完整指南5分鐘上手11個獲獎數據集快速復現大模型逆擴展曲線【免費下載鏈接】prizeA prize for finding tasks that cause large language models to show inverse scaling項目地址: https://gitcode.com/gh_mirrors/pr/prizeInverse Scaling Prize逆擴展獎官方數據發布包收錄了全部 11 個獲獎數據集專門用于研究大模型越大、表現反而越差的逆擴展Inverse Scaling現象。本文帶你 5 分鐘上手數據格式、字段說明與圖表結構快速復現大模型逆擴展曲線適合剛接觸 LLM 評測的讀者。一、什么是逆擴展30 秒理解越大越差 按擴展定律Scaling Laws語言模型參數越多、訓練算力越大基準測試表現通常越好。但 Inverse Scaling Prize 發現了一類反例任務模型越強錯誤反而越多。該賽事由 AI 安全研究機構于 2022 年發起總獎池 25 萬美元目標是找到重要且可復現的逆擴展任務。經過兩輪評審官方在 2023 年 3 月一次性發布了全部 11 個獲獎數據集。下面的圖是典型的逆擴展曲線橫軸為模型算力FLOPs縱軸為負對數損失。可以看到 Gopher、OPT 等模型系列越大的版本在 Memo Trap 任務上損失越高表現越差二、5 分鐘上手獲取 11 個獲獎數據集 1. 克隆倉庫獲取數據發布包所有數據位于data-release/isp-data-release.zip克隆倉庫即可拿到git clone https://gitcode.com/gh_mirrors/pr/prize2. 解壓并查看數據unzip />少樣本條件下許多任務的逆擴展依然存在。下圖是 Gopher 系列在 Into the Unknown 數據集上的表現五、使用數據前必讀的注意事項 ??Canary 字符串數據中嵌入了 BIG-Bench 風格的 canary GUID聲明基準數據不應出現在訓練語料中請勿將其用于模型預訓練許可證全部數據采用 CC-BY 4.0 許可Modus Tollens 勘誤數據發布后發現有少于 10% 的樣例存在語法錯誤官方仍保留這些樣例如需過濾受影響的樣例下標已列在data-release/modus-tollens_affected_indices.txt數據清理resisting-correction有意略去 part 1memo-trap僅保留 part 1 與 3完整變更記錄見data-release/README.md六、常見問題 FAQ Q復現曲線需要花錢調 API 嗎A不需要。官方曲線已完整收錄在plots/目錄若要自己在開源模型如 OPT上重跑使用 Hugging Face 上的開源權重即可零成本。Qpart和round字段有什么用Apart區分數據集內部的不同子集如sig-figs有 21 個部分round標明數據提交自哪一輪兩輪之間更新過的任務resisting-correction、redefine只保留了第二輪版本。Q數據量有多大夠跑實驗嗎A11 個數據集共約 22 MB單文件從幾百條如neqa到上萬條不等全部滿足賽事至少 300 條的最低門檻多數在千條量級足以觀察到清晰的縮放趨勢。總結Inverse Scaling Prize 數據發布包是目前研究大模型逆擴展現象最權威的公開資源——11 個獲獎數據集 三類官方評測曲線開箱即用。克隆倉庫、解壓data-release/isp-data-release.zip即可在 5 分鐘內開始你的復現實驗。【免費下載鏈接】prizeA prize for finding tasks that cause large language models to show inverse scaling項目地址: https://gitcode.com/gh_mirrors/pr/prize創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考