一內(nèi)存優(yōu)先于CPU跑分,配置口訣一步到位)
大家好最近一直在折騰 Mac 上的本地 AI 部署發(fā)現(xiàn)很多新手在選機(jī)器時(shí)最容易翻車的地方不是選 CPU 核心數(shù)而是把注意力放在了 CPU 跑分上。尤其是 Air 和 Pro 型號(hào)差別、M 系列不同芯片的內(nèi)存帶寬差異這些細(xì)節(jié)一旦沒弄清楚很容易買回來發(fā)現(xiàn)模型跑不動(dòng)或者跑起來卡成 PPT。這篇文章我想完整講清楚一個(gè)核心結(jié)論在 Mac 上跑本地 AI 模型選配置的第一優(yōu)先級(jí)永遠(yuǎn)是統(tǒng)一內(nèi)存第二才是 CPU 和 GPU 核心數(shù)CPU 跑分參考價(jià)值很低。文章會(huì)用通俗解釋搭配實(shí)際案例最后給出四檔配置口訣方便你直接照著選。文章適合下面幾類讀者想在 Mac 上本地部署大模型的開發(fā)者。正在糾結(jié)買 MacBook Air / Pro、Mac mini / Studio 的朋友。已經(jīng)入手 Mac但感覺本地 AI 推理速度不對(duì)想找到原因的人。準(zhǔn)備給團(tuán)隊(duì)采購 Mac 作為 AI 開發(fā)機(jī)的負(fù)責(zé)人。讀完這篇文章你會(huì)掌握本地 AI 的內(nèi)存需求如何估算、統(tǒng)一內(nèi)存為什么是最大瓶頸、四檔配置如何對(duì)應(yīng)不同模型規(guī)模以及一套完整的本地部署驗(yàn)證流程。1. 為什么 Mac 適合跑本地 AI1.1 本地 AI 到底是什么本地 AI 指的是把模型文件下載到電腦上在不聯(lián)網(wǎng)的條件下直接運(yùn)行推理。和網(wǎng)頁版 Chat 服務(wù)不同本地 AI 的優(yōu)勢(shì)是隱私數(shù)據(jù)不出設(shè)備、沒有請(qǐng)求限制、支持離線使用還能自由微調(diào)和實(shí)驗(yàn)。在 Mac 上跑本地 AI 前幾年還比較冷門因?yàn)橹髁?AI 框架大多優(yōu)先支持 NVIDIA GPU。但最近兩年情況發(fā)生了很大變化Mac 的 Metal、Core ML、llama.cpp 以及 Ollama 等開源工具不斷優(yōu)化M 系列芯片跑大模型的體驗(yàn)已經(jīng)非常接近入門級(jí)專業(yè)顯卡。1.2 Mac 統(tǒng)一內(nèi)存的特殊優(yōu)勢(shì)Mac 的 M 系列芯片不使用獨(dú)立顯卡而是把 CPU、GPU 和內(nèi)存封裝在同一塊 SoC 上。所有模塊共享同一塊內(nèi)存這就是“統(tǒng)一內(nèi)存”。傳統(tǒng) PC 架構(gòu)里CPU 和顯卡各有一塊獨(dú)立內(nèi)存顯存不夠用時(shí)需要把數(shù)據(jù)復(fù)制到內(nèi)存?zhèn)鬏斔俣嚷胰菀壮霈F(xiàn)瓶頸。Mac 的統(tǒng)一內(nèi)存則不同CPU 和 GPU 都直接訪問同一塊物理內(nèi)存不用來回拷貝數(shù)據(jù)。在跑大模型時(shí)模型權(quán)重需要整個(gè)放到“顯存”里。對(duì) Mac 來說這塊“顯存”就是統(tǒng)一內(nèi)存。所以內(nèi)存容量直接決定了你能跑多大的模型。這也是為什么選 Mac 跑本地 AI 時(shí)內(nèi)存容量比 CPU 核心數(shù)重要得多。1.3 CPU 跑分為什么會(huì)有誤導(dǎo)性跑分軟件測(cè)的是處理器在特定負(fù)載下的綜合性能比如單核、多核、浮點(diǎn)運(yùn)算、內(nèi)存延遲等。但大模型推理并不是典型的 CPU 密集型負(fù)載它的核心是矩陣乘法和內(nèi)存帶寬調(diào)度。也就是說即使你的 CPU 跑分很高如果內(nèi)存帶寬不夠模型 token 生成速度依然會(huì)很慢。反過來CPU 跑分不高但內(nèi)存帶寬充足推理體驗(yàn)反而可能更好。這就是很多人“按跑分買 Mac”之后覺得不對(duì)勁的原因。另外不同跑分軟件的測(cè)試場(chǎng)景不同Geekbench 偏向真實(shí)應(yīng)用混合負(fù)載Cinebench 偏向渲染但他們都沒有針對(duì)“大模型推理”這個(gè)專門的負(fù)載建模。用這類成績(jī)衡量 AI 性能誤差會(huì)非常大。2. 大模型是怎么占用內(nèi)存的2.1 模型參數(shù)與內(nèi)存換算大模型的內(nèi)存占用主要由“參數(shù)量”和“精度類型”決定。以一個(gè) 70 億參數(shù)模型為例如果使用 FP32 精度每個(gè)參數(shù)占 4 字節(jié)總占用約 28GB。如果使用 FP16/BF16 精度每個(gè)參數(shù)占 2 字節(jié)總占用約 14GB。如果使用 INT8 量化每個(gè)參數(shù)占 1 字節(jié)總占用約 7GB。如果使用 INT4 量化每個(gè)參數(shù)約 0.5 字節(jié)總占用約 3.5GB。所以在 8GB 內(nèi)存的 Mac 上跑 7B 模型理論上只有使用 INT4 量化才比較可行在 16GB 內(nèi)存的 Mac 上跑 7B 模型則可以留出一定余量加載速度也更快。實(shí)際占用還會(huì)額外增加一些緩存和運(yùn)行時(shí)開銷例如 KV cache、上下文窗口、tokenizer 等。經(jīng)驗(yàn)做法是在模型權(quán)重占用基礎(chǔ)上再預(yù)留 2GB 到 4GB 的系統(tǒng)余量。2.2 常見模型的推薦內(nèi)存下面的表格基于當(dāng)前常見開源模型的量化情況做大致估算適合作為選型參考模型規(guī)模量化精度權(quán)重占用約推薦最低內(nèi)存推薦舒適內(nèi)存1B ~ 3BINT41GB ~ 2GB8GB16GB7B ~ 8BINT44GB ~ 5GB16GB32GB14BINT48GB ~ 10GB32GB64GB32BINT418GB ~ 20GB64GB128GB70BINT438GB ~ 40GB128GB128GB注意這里的“推薦最低內(nèi)存”不是讓你把內(nèi)存全部吃掉而是要留出操作系統(tǒng)和其他應(yīng)用運(yùn)行的空間。如果系統(tǒng)內(nèi)存不夠macOS 會(huì)觸發(fā)內(nèi)存壓縮和 Swap 交換推理速度會(huì)斷崖式下降。2.3 為什么內(nèi)存帶寬也是關(guān)鍵指標(biāo)除了容量?jī)?nèi)存帶寬決定了一次能讀多少數(shù)據(jù)。大模型推理時(shí)每一步都需要讀取全部權(quán)重?cái)?shù)據(jù)內(nèi)存帶寬越高token 生成速度越快。Mac 各系列芯片的內(nèi)存帶寬差異很大例如基礎(chǔ)型號(hào) M 系列在 100GB/s 左右Pro 系列通常在 200GB/s 左右Max 系列大約 400GB/sUltra 系列可以到 800GB/s。具體數(shù)值以蘋果官方和實(shí)測(cè)為準(zhǔn)。如果你只是偶爾跑 7B 模型入門款也能用如果你需要頻繁推理 32B 以上模型Max 系列會(huì)明顯更流暢。這也是為什么同是 64GB 內(nèi)存Max 芯片體驗(yàn)更佳。3. 四檔配置口訣照著選不會(huì)錯(cuò)3.1 第一檔入門體驗(yàn)檔16GB口訣16GB 跑 7B量化模型剛合適。適合人群學(xué)生、前端開發(fā)者、日常寫代碼偶爾玩 AI 的輕量用戶。這一檔通常對(duì)應(yīng) MacBook Air 或入門級(jí) Mac mini統(tǒng)一內(nèi)存 16GB。可以流暢運(yùn)行 7B 到 8B 模型的 INT4 量化版本例如 Qwen2.5 7B、Llama 3.1 8B 等常見開源模型。使用場(chǎng)景包括本地執(zhí)行代碼補(bǔ)全。簡(jiǎn)單的文本摘要、翻譯、改寫。學(xué)習(xí) LangChain 或 LlamaIndex 的 API 用法。跑小規(guī)模的 Embedding 模型做 RAG 實(shí)驗(yàn)。不建議在這一檔跑 14B 以上模型內(nèi)存容易不夠即使能加載速度也很折磨。3.2 第二檔主流實(shí)用檔32GB口訣32GB 上 14B主流開發(fā)不折騰。適合人群做 LLM 應(yīng)用開發(fā)的工程師、經(jīng)常跑多個(gè)小模型的研究生。32GB 是目前性價(jià)比比較高的檔位對(duì)應(yīng) MacBook Pro 14 / 16 英寸或 Mac mini 高配。這一檔可以比較從容地運(yùn)行 14B 模型也可以同時(shí)跑 7B 模型 Embedding 模型 RAG 服務(wù)。推薦的工作組合Ollama 跑 14B Chat 模型。Docker 跑向量數(shù)據(jù)庫。VS Code Continue 插件做本地代碼補(bǔ)全。Python 進(jìn)程進(jìn)行數(shù)據(jù)預(yù)處理。如果你的預(yù)算只夠一份配置我建議優(yōu)先考慮 32GB而不是花更多錢買更高端芯片但內(nèi)存 24GB 的版本。因?yàn)楸镜?AI 場(chǎng)景下多出來的 8GB 內(nèi)存通常比那幾顆 CPU 核心更有價(jià)值。3.3 第三檔極客進(jìn)階檔64GB口訣64GB 沖 32B本地小集群。適合人群AI 算法工程師、后期制作人、需要本地微調(diào)和小規(guī)模并行實(shí)驗(yàn)的技術(shù)玩家。64GB 統(tǒng)一內(nèi)存是一道分水嶺。這個(gè)容量可以運(yùn)行 32B 模型的 INT4 量化版本也能跑多個(gè) 7B 模型并行推理。如果你想在本地做 LoRA 微調(diào)實(shí)驗(yàn)64GB 也會(huì)從容許多。這一檔通常推薦 MacBook Pro 高配或 Mac Studio 基礎(chǔ)版。可以選的芯片主要是 M4 Pro / M4 Max 系列具體型號(hào)看預(yù)算但內(nèi)存優(yōu)先原則不變。使用場(chǎng)景擴(kuò)展運(yùn)行 32B 代碼模型做復(fù)雜代碼生成。本地跑 RAG 多文檔問答上下文窗口拉長(zhǎng)。嘗試語音識(shí)別、圖像生成等多模態(tài)模型。并行部署 2 到 3 個(gè)不同模型做對(duì)比測(cè)試。如果考慮未來兩年不換電腦64GB 是比較保險(xiǎn)的選擇。3.4 第四檔專業(yè)頂配檔128GB 及以上口訣128GB 戰(zhàn) 70B接近服務(wù)器體驗(yàn)。適合人群專業(yè)研究者、需要離線處理大規(guī)模數(shù)據(jù)的團(tuán)隊(duì)、預(yù)算充足的資深開發(fā)者。128GB 統(tǒng)一內(nèi)存可以運(yùn)行 70B 模型的 INT4 量化版本也可以運(yùn)行多個(gè) 32B 模型而不互相干擾。Mac Studio / Mac Pro 的高配型號(hào)是這個(gè)檔位的代表。這一檔適合本地運(yùn)行 70B 及以上級(jí)別的開源模型。大數(shù)據(jù)量文檔檢索場(chǎng)景。離線批量推理任務(wù)。在本地復(fù)現(xiàn)論文里的模型效果。不過要注意128GB 頂配價(jià)格不低但對(duì)比購買同等顯存的專業(yè) GPU 服務(wù)器Mac 在能源消耗、噪音、體積上仍然有明顯優(yōu)勢(shì)。這也是很多個(gè)人開發(fā)者和中小團(tuán)隊(duì)選擇 Mac Studio 的原因。3.5 四檔口訣總結(jié)表檔位內(nèi)存可跑模型規(guī)模推薦芯片典型用途入門體驗(yàn)檔16GB7B ~ 8B INT4M 系列基礎(chǔ)芯片輕量實(shí)驗(yàn)、代碼補(bǔ)全主流實(shí)用檔32GB14B INT4M4 Pro / 基礎(chǔ) MaxLLM 應(yīng)用開發(fā)、多模型小任務(wù)極客進(jìn)階檔64GB32B INT4M4 Pro / Max多模態(tài)、并行推理、LoRA 實(shí)驗(yàn)專業(yè)頂配檔128GB70B INT4M4 Max / Ultra專業(yè)研究、離線批量推理4. 完整實(shí)戰(zhàn)在 Mac 上部署并驗(yàn)證本地 AI理論講完我們動(dòng)手做一次完整的本地 AI 部署。這里以 Ollama 為例因?yàn)樗С?macOS 原生運(yùn)行配置簡(jiǎn)單模型管理方便。4.1 檢查你的 Mac 基礎(chǔ)環(huán)境先確認(rèn)系統(tǒng)版本、芯片型號(hào)、統(tǒng)一內(nèi)存容量打開“終端”執(zhí)行sw_vers uname -m sysctl -n hw.memsize輸出大致如下ProductName: macOS ProductVersion: 14.5 BuildVersion: 23F79 arm64 17179869184這里的17179869184字節(jié)除以 1024^3 就是 16GB。也就是說我這臺(tái)測(cè)試機(jī)的統(tǒng)一內(nèi)存剛好對(duì)應(yīng)“入門體驗(yàn)檔”。接著查看芯片型號(hào)和內(nèi)存帶寬限制可以用system_profiler SPHardwareDataType重點(diǎn)關(guān)注Chip、Memory字段。4.2 安裝 Ollama打開終端執(zhí)行brew install ollama如果沒有安裝 Homebrew先裝 Homebrew/bin/bash -c $(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)安裝完成后啟動(dòng) Ollama 服務(wù)ollama serve如果想開機(jī)自啟可以用brew services start ollama。啟動(dòng)后終端會(huì)顯示服務(wù)監(jiān)聽地址通常為127.0.0.1:11434。4.3 拉取并運(yùn)行一個(gè) 7B 模型打開另一個(gè)終端窗口拉取模型ollama pull qwen2.5:7b這個(gè)命令會(huì)自動(dòng)從模型倉庫下載對(duì)應(yīng)的量化模型文件。下載完成后運(yùn)行ollama run qwen2.5:7b進(jìn)入對(duì)話后輸入下面內(nèi)容測(cè)試請(qǐng)用一句中文介紹什么是本地大模型。正常輸出類似本地大模型是指部署在個(gè)人電腦或本地服務(wù)器上的大語言模型數(shù)據(jù)不需要上傳到云端可在離線環(huán)境中完成推理和生成。退出對(duì)話在終端里輸入/bye即可。4.4 查看模型實(shí)際占用內(nèi)存模型運(yùn)行后另開一個(gè)終端執(zhí)行ps aux | grep ollama或者在活動(dòng)監(jiān)視器里找ollama進(jìn)程的內(nèi)存占用。通常一個(gè) 7B INT4 模型會(huì)占用 4GB 到 6GB 內(nèi)存具體受上下文窗口和緩存策略影響。4.5 做一個(gè)簡(jiǎn)單的推理耗時(shí)代碼為了驗(yàn)證“內(nèi)存與模型推理速度”的關(guān)系寫一個(gè) Python 腳本用 Ollama 的 HTTP API 連續(xù)請(qǐng)求 10 次統(tǒng)計(jì)平均耗時(shí)。先創(chuàng)建 Python 文件mkdir -p ~/local-ai-test cd ~/local-ai-test cat test_inference.py EOF import time import urllib.request def call_ollama(prompt): body {model:qwen2.5:7b,prompt:%s,stream:false} % prompt req urllib.request.Request( http://127.0.0.1:11434/api/generate, databody.encode(utf-8), headers{Content-Type: application/json}, ) start time.time() with urllib.request.urlopen(req, timeout120) as resp: data resp.read() cost time.time() - start return cost, len(data) if __name__ __main__: costs [] for i in range(10): cost, size call_ollama(請(qǐng)用一句話介紹機(jī)器學(xué)習(xí)) costs.append(cost) print(第 %d 次耗時(shí): %.2fs, 返回?cái)?shù)據(jù)大小: %d 字節(jié) % (i 1, cost, size)) avg sum(costs) / len(costs) print(平均耗時(shí): %.2fs % avg) EOF運(yùn)行python3 test_inference.py你會(huì)看到類似輸出第 1 次耗時(shí): 3.24s, 返回?cái)?shù)據(jù)大小: 1034 字節(jié) 第 2 次耗時(shí): 1.87s, 返回?cái)?shù)據(jù)大小: 1201 字節(jié) ... 平均耗時(shí): 2.15s第一次調(diào)用較慢通常是因?yàn)槟P托枰獜拇疟P加載到內(nèi)存后續(xù)調(diào)用會(huì)走緩存速度明顯提升。如果內(nèi)存不足導(dǎo)致 swap平均耗時(shí)會(huì)出現(xiàn)明顯抖動(dòng)。5. 常見問題與排查思路5.1 模型加載后系統(tǒng)內(nèi)存爆滿問題現(xiàn)象常見原因解決思路加載模型后系統(tǒng)卡頓模型權(quán)重占用過高系統(tǒng)開始 Swap換更小模型或更高量化倍數(shù)的權(quán)重活動(dòng)監(jiān)視器顯示內(nèi)存壓力為紅色模型所需內(nèi)存超過物理內(nèi)存關(guān)閉其他應(yīng)用或升級(jí)內(nèi)存加載模型時(shí)提示內(nèi)存不足選擇了超出內(nèi)存容量的模型下載時(shí)確認(rèn)模型參數(shù)量和量化精度排查時(shí)可以先用vm_stat觀察內(nèi)存壓力或者直接看活動(dòng)監(jiān)視器。如果內(nèi)存壓力是綠色說明還有余量如果是黃色或紅色就要考慮替換模型了。5.2 推理速度慢問題現(xiàn)象常見原因解決思路token 生成很慢內(nèi)存帶寬不足或模型太大降低模型規(guī)模、換更高帶寬芯片首次請(qǐng)求特別慢模型冷加載預(yù)熱模型或常駐 Ollama 服務(wù)多任務(wù)時(shí)速度下降其他進(jìn)程占用 CPU / 內(nèi)存關(guān)閉瀏覽器標(biāo)簽頁、Docker 容器等大模型推理速度還會(huì)受到上下文長(zhǎng)度影響。上下文越長(zhǎng)每一步需要重新計(jì)算的緩存就越多速度會(huì)下降。如果只需要短問答可以把上下文窗口調(diào)低。5.3 下載模型失敗或中斷網(wǎng)絡(luò)問題是下載模型時(shí)的高頻問題。建議使用鏡像源或代理工具但要注意合規(guī)使用。Ollama 支持通過環(huán)境變量指定模型倉庫export OLLAMA_MODELS/Volumes/Data/ollama把模型文件保存到大容量外置硬盤也能緩解內(nèi)置硬盤空間不足的問題。5.4 Ollama 服務(wù)無法啟動(dòng)首先檢查端口是否被占用lsof -i :11434如果端口被占用殺掉對(duì)應(yīng)進(jìn)程后重試kill -9 PID然后手動(dòng)啟動(dòng)ollama serve如果啟動(dòng)報(bào)錯(cuò)查看日志brew services info ollama5.5 使用 CPU 還是 GPU 推理在 Mac 上Ollama 默認(rèn)會(huì)優(yōu)先使用 Metal GPU 加速。如果想強(qiáng)制使用 CPU 測(cè)試對(duì)比可以在啟動(dòng)前設(shè)置export OLLAMA_LLM_LIBRARYcpu然后重啟 Ollama。你會(huì)發(fā)現(xiàn)同一模型 CPU 推理時(shí)間明顯變長(zhǎng)。這個(gè)對(duì)比也說明只看 CPU 跑分沒有意義GPU/內(nèi)存帶寬才是本地 AI 的勝負(fù)手。6. 最佳實(shí)踐與工程建議6.1 內(nèi)存選擇寧大勿小在 Mac 上選配置我強(qiáng)烈建議遵循“內(nèi)存優(yōu)先”原則。CPU 多幾個(gè)核心、GPU 多幾個(gè)核對(duì)本地 AI 的提升遠(yuǎn)不如多 16GB 內(nèi)存明顯。而且內(nèi)存一旦買定就無法后期擴(kuò)展芯片規(guī)格不夠還可以通過外接設(shè)備彌補(bǔ)一部分但內(nèi)存不足是硬傷。尤其不要為了多一檔 CPU 芯片而犧牲內(nèi)存容量。很多用戶最后后悔都不是覺得 CPU 不夠而是內(nèi)存不夠跑更大模型。6.2 模型選擇與量化精度優(yōu)先選擇量化后能“留出 30% 內(nèi)存余量”的模型。比如 32GB 內(nèi)存的機(jī)器模型權(quán)重控制在 20GB 以內(nèi)比較穩(wěn)妥。這樣系統(tǒng)還有空間運(yùn)行 Ollama 服務(wù)、代碼編輯器、瀏覽器等。常用判斷邏輯7B 模型用 INT4 量化權(quán)重約 4-5GB總內(nèi)存 16GB 足夠。14B 模型用 INT4 量化權(quán)重約 8-10GB總內(nèi)存 32GB 起步。32B 模型用 INT4 量化權(quán)重約 18-20GB總內(nèi)存 64GB 起步。70B 模型用 INT4 量化權(quán)重約 38-40GB總內(nèi)存 128GB 起步。6.3 保持 Ollama 服務(wù)常駐頻繁啟動(dòng)和退出 Ollama 會(huì)反復(fù)加載模型導(dǎo)致首請(qǐng)求很慢。開發(fā)機(jī)建議保持服務(wù)常駐brew services start ollama同時(shí)可以設(shè)置環(huán)境變量控制模型緩存數(shù)量默認(rèn)情況下最近用過的模型會(huì)留在內(nèi)存中方便快速切換。6.4 日志與監(jiān)控排查問題時(shí)可以在終端實(shí)時(shí)查看進(jìn)程運(yùn)行狀態(tài)top -o MEM -n 10或者用powermetrics觀察功耗不過該命令需要sudo權(quán)限不建議在生產(chǎn)環(huán)境長(zhǎng)期運(yùn)行只作為臨時(shí)診斷工具。6.5 注意散熱與耗電本地跑大模型時(shí) Mac 風(fēng)扇可能會(huì)明顯加速這是正常現(xiàn)象。如果你經(jīng)常長(zhǎng)時(shí)間跑推理任務(wù)建議使用支持散熱較好的 MacBook Pro 或 Mac Studio。避免在被子或沙發(fā)上長(zhǎng)時(shí)間高負(fù)載運(yùn)行。調(diào)整系統(tǒng)“低電量模式”限制功耗以降低溫度。7. 總結(jié)與下一步建議選 Mac 跑本地 AI最簡(jiǎn)單的記憶方式就是看“統(tǒng)一內(nèi)存容量”。CPU 跑分和核心數(shù)不是關(guān)鍵指標(biāo)內(nèi)存帶寬和容量才是決定模型規(guī)模與推理速度的核心因素。16GB 適合 7B 模型入門32GB 能跑 14B 模型滿足主流開發(fā)64GB 能應(yīng)對(duì) 32B 模型和并行推理128GB 以上則可以沖擊 70B 級(jí)別的大模型。如果看完這篇文章你還拿不定主意建議先去二手平臺(tái)租幾天不同配置的 Mac 試跑一下用 Ollama 加載自己最需要的模型感受一下速度再?zèng)Q定。下一步可以繼續(xù)學(xué)習(xí)學(xué)習(xí) GGUF 量化格式的原理了解不同量化等級(jí)對(duì)效果和速度的影響。嘗試用 llama.cpp 源碼編譯手動(dòng)體驗(yàn) Metal GPU 加速的細(xì)節(jié)。使用 LangChain 配合本地 Ollama API 搭建一個(gè)基于 RAG 的知識(shí)庫問答系統(tǒng)。探索多模型并行方案比如 Embedding 模型 Chat 模型 Agent 調(diào)度框架。本地 AI 是一個(gè)實(shí)踐性很強(qiáng)的方向紙面參數(shù)只是一部分真正可靠的判斷來自實(shí)際運(yùn)行效果。希望這篇教程能幫你避開“只看 CPU 跑分”的坑選到真正適合自己需求的 Mac 配置。祝你在本地 AI 的世界里玩得開心