
gpu-burn 使用指南多 GPU 壓力測試與顯卡驗機完整教程【免費下載鏈接】gpu-burnMulti-GPU CUDA stress test項目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn剛組好一臺裝 8 張顯卡的服務器部署訓練任務前總擔心某張卡在高負載下悄悄出錯。gpu-burn 是一款多 GPU CUDA 壓力測試工具讓所有顯卡同時跑滿浮點運算并自動校驗計算結果、逐卡輸出 OK/FAULTY。 適合誰用如果你維護帶多張 NVIDIA GPU 的機器——新機器驗收、上架前烤機、或者想排查某張卡是不是壞了——它都能派上用場。不用搭深度學習環境一條命令就能讓所有卡同時滿載省去了逐張卡測試的時間。 快速上手三步跑通每步都很短1?? 克隆源碼到本地git clone https://gitcode.com/gh_mirrors/gp/gpu-burn cd gpu-burn2?? 編譯Makefile 會自動探測 CUDA 安裝位置make3?? 先列出全部顯卡再做一次 5 分鐘冒煙測試./gpu_burn -l ./gpu_burn 300結束時每張卡都會打印 OK 或 FAULTY全綠就可以放心繼續。 核心特性 燃燒時長直接寫進命令不需要任何配置文件命令行最后一個參數就是秒數到點自動停。./gpu_burn 600 顯存占用精確可控-m決定吃多少顯存可以給固定 MB 數也可以給可用顯存的百分比默認 90%。機器上還有別的進程時用百分比更穩./gpu_burn -m 4096 1200 # 固定 4GB跑 20 分鐘 ./gpu_burn -m 50% 60 # 半塊顯存跑 1 分鐘 單卡定點測試-i N只壓編號為 N 的那張卡用來隔離嫌疑對象非常順手。./gpu_burn -i 2 1800 雙精度與 Tensor 核心模式-d切換成雙精度浮點運算精度更高、更吃算力-tc嘗試調用 Tensor 核心GPU 里專門加速矩陣運算的硬件單元。./gpu_burn -d 3600 ./gpu_burn -tc 600? 自帶結果校驗它不是單純把風扇吹熱內核在持續比較運算結果的差值錯誤數會實時累計。任何一張卡被判 FAULTY把該卡下線檢修就行不用整臺機器陪跑。 進階玩法 Docker 一鍵部署服務器環境臟、不想動系統里的 CUDA 版本時直接打容器鏡像docker build -t gpu-burn . docker run --rm --gpus all gpu-burn鏡像默認跑 60 秒構建時可用--build-arg COMPUTE75 --build-arg CUDA_VERSION13.0.0指定計算能力和 CUDA 版本。?? 構建時指定計算能力計算能力是 NVIDIA 給每代 GPU 架構的編號編譯參數要和你的卡匹配默認 7.5Turing30 系用 8640 系用 89H100 用 90。make COMPUTE89CUDA 裝在非默認路徑時加make CUDAPATH/usr/local/cuda-12.0。 Windows 版本win/ 目錄是官方 Windows 移植版需要 CMake 和 Visual Studio 的 C 工具鏈build.bat -c 86編譯出的 gpu_burn.exe 參數和 Linux 版完全一致共享同一套內核。 實戰案例場景一新服務器 24 小時驗收./gpu_burn -d 86400雙精度全卡燃燒一整天另開終端watch -n 5 nvidia-smi盯溫度和功耗整夜無 FAULTY 再交付。場景二定位偶發卡死的嫌疑卡先./gpu_burn -l確認編號再只壓那張可疑的卡./gpu_burn -i 1 -m 80% 3600單卡 80% 顯存壓 1 小時復現 FAULTY 基本可以斷定是硬件問題直接走售后。? 常見問題Qmake 提示找不到 nvccACUDA 工具鏈沒裝或不在默認路徑裝上后執行make CUDAPATH/usr/local/cuda-12.0。Q新架構的卡該填多少 COMPUTEA對照架構查20 系 75、30 系 86、40 系 89、H100 為 90。Q提示顯存不足但 nvidia-smi 明明還有空余A先確認沒有別的進程占卡再把-m降到 50% 留出余量重試。寫在最后壓力測試是確認 GPU 可靠性的最硬核方式建議長夜掛機后再復測一輪。現在就可以克隆倉庫、編譯然后跑一次./gpu_burn 300的 5 分鐘冒煙測試。【免費下載鏈接】gpu-burnMulti-GPU CUDA stress test項目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考