台灣脈絡

Google曝記憶體牆 推TPU分流與壓縮6倍

已沉寂
1報告2篇2家追蹤自
AIGoogleSEMICON TaiwanTPU記憶體
初始報導
重點摘要
  • Google指AI運算瓶頸已從FLOPS轉向記憶體頻寬
  • 記憶體佔AI伺服器TCO逾75%[1]
  • 今年首度同年推出訓練用TPU v8t與推論用TPU v8i
  • TurboQuant演算法將KV Cache記憶體需求壓縮6倍
  • Cherian稱壓縮6倍後記憶體「仍然不夠」
  • Google Cloud上季營收248億美元、年增80%
展開完整內容

(綜合壹蘋新聞網、中時電子報等2家媒體報導)

Google Cloud供應鏈基礎設施資深總監Nikhil Cherian於SEMICON Taiwan 2026記憶體高峰論壇指出,AI模型規模邁向兆級參數,運算瓶頸已從FLOPS轉向記憶體頻寬,記憶體更成為AI伺服器總持有成本(TCO)的主要驅動因素,佔比超過75%[1]。

為突破「記憶體牆」,Google今年首度將訓練與推論的TPU硬體分流,同年推出訓練用TPU v8t及推論用TPU v8i。Cherian表示,業界預估2027年約80%運算需求來自推論,預訓練僅佔20%,兩者硬體需求已明顯不同。TPU v8t可將9600顆晶片串聯成單一Superpod,提供121 ExaFLOPS運算能力及2PB記憶體;推論用TPU v8i則將晶片內SRAM提高3倍至384MB,HBM容量增加50%至每顆288GB,使活躍KV Cache能留在晶片端。

軟體方面,Google透過TurboQuant演算法將KV Cache記憶體需求壓縮至原本六分之一,同時維持模型準確度。Cherian笑稱,即使壓縮6倍,「對Google的企圖而言,記憶體仍然不夠」。供應鏈方面,Google與記憶體供應商長期合作投資產能,並翻新退役伺服器、回收可用零組件,甚至開發特殊硬體介面轉接器,讓DDR4等舊世代記憶體導入新一代AI伺服器。

Cherian指出,Google Cloud上季營收約248億美元、年增80%,已簽約、等待部署的訂單積壓金額達5140億美元。即使透過軟體壓縮、TPU分流及零組件循環利用,Google記憶體需求仍持續攀升。

本事件已沉寂,相關脈絡見「相關事件」