
過去幾年,人工智能芯片的競爭主線一直圍繞計算單元、內存帶寬、封裝和互連展開。但隨著大模型參數規模不斷擴大,一個越來越明顯的問題出現了:真正限制推理性能的,很多時候并不是計算能力,而是數據搬運。傳統處理器需要不斷在計算單元與存儲器之間搬運權重、激活值和中間結果。尤其是大模型推理過程中,大量時間和能耗并不是消耗在乘法本身,而是消耗在:“把數據送到計算單元,再把結果送回來。”因此,一類非常激進的架構開始出現:既然模型權重在推理過程中基本不變,為什么還要每次從外部存儲器讀取?一種極端答案就是:直接把模型權重固化到芯片電路中。這正是Taalas式專用推理芯片最值得研究的地方。它并不是簡單地把GPU做得更快,而是試圖重新定義“存儲器”和“計算器”的邊界。一、傳統AI芯片為什么離不開HBM?理解這種架構之前,首先需要弄清楚GPU、TPU等主流AI加速器到底在解決什么問題。以Transformer推理為例,核心計算之一就是:Y=XW其中:(X) 是輸入激活;(W) 是模型權重;(Y) 是計算結果。從數學角度看,這只是矩陣乘法。但從硬件角度看,問題復雜得多。計算單元本身進