
這項合作在 AMD 首席執(zhí)行官蘇姿豐(Lisa Su)周四發(fā)表的 " 推進(jìn) AI" 主題演講中正式公布。此舉填補了 AMD 產(chǎn)品組合中的關(guān)鍵空白。此前,英偉達(dá)曾花費 200 億美元收購 Groq 相關(guān)人才,以彌補其在快速推理領(lǐng)域的短板。
SRAM 技術(shù)賦能高效推理
Cerebras 聯(lián)合創(chuàng)始人兼首席執(zhí)行官安德魯 · 費爾德曼(Andrew Feldman)曾批評英偉達(dá)僅為 "AI 軍火商 "。與依賴 HBM4 顯存的 GPU 不同,Cerebras 的晶圓級引擎(WSE)采用片上 SRAM 技術(shù),速度比傳統(tǒng)方案高出數(shù)個數(shù)量級。憑借這一優(yōu)勢,Cerebras 已成為全球最快的推理服務(wù)提供商之一,輸出速度經(jīng)常超過每秒 2,000 個 Token。
在該聯(lián)合方案中,AMD Instinct GPU 負(fù)責(zé)處理計算密集型的提示詞(Prompt)操作,而內(nèi)存密集型的 Token 生成任務(wù)則卸載給 Cerebras 的 WSE 加速器。雙方旨在實現(xiàn)更高交互性,同時不犧牲吞吐量或增加成本。費爾德曼表示,這種組合結(jié)合了 Instinct 在性能和內(nèi)存容量上的優(yōu)勢,以及 WSE 在 SRAM 和內(nèi)存帶寬上的領(lǐng)先地位,能提供無與倫比的解決方案。
盡管兩家公司未透露具體數(shù)據(jù),但預(yù)計該組合將使每瓦特電力消耗所產(chǎn)生的 Token 數(shù)量提升高達(dá) 5 倍。
對標(biāo) Groq LPU,效率顯著優(yōu)化
Cerebras 加速器在此處的角色,類似于英偉達(dá)在 GTC 大會上隨 Vera Rubin 機架系統(tǒng)發(fā)布的 Groq LPU(語言處理單元)。然而,在服務(wù)像 Kimi K2.5 這樣的萬億參數(shù)模型時,英偉達(dá)方案需要相當(dāng)于 2,000 顆 Groq LPU 的 SRAM 資源,而 AMD 與 Cerebras 的組合最多只需幾十個加速器即可勝任。
該聯(lián)合解決方案將于今年晚些時候在 Cerebras Cloud 上線。蘇姿豐在隨后的新聞發(fā)布會上表示,Cerebras 的技術(shù)與 Helios 配合良好,AMD 開放生態(tài)系統(tǒng)的理念是與擁有有用技術(shù)的多家公司合作。她補充道,未來將繼續(xù)進(jìn)行更多的工作負(fù)載解耦嘗試。
【星途科訊 圖文丨略略 首發(fā)于 ZAKER 科技,轉(zhuǎn)載請注明出處】