UltraMem是由位元組跳動豆包大模型Foundation團隊於2025年2月提出的創新型稀疏模型架構,通過解耦計算與參數的核心設計思路,有效解決了傳統混合專家(MoE)架構在推理階段的高額訪存問題。實驗數據顯示,該架構在2000萬value規模下推理速度較MoE架構提升2-6倍,推理成本最高降低83%,同時驗證了其優於傳統架構的Scaling Law擴展特性。技術實現層面,UltraMem採用Tucker分解查詢-鍵檢索(TDQKR)方法和虛擬記憶體擴展機制,在保持模型效果的前提下完成計算資源最佳化,為大規模AI模型的高效部署開闢了新路徑。
基本介紹
- 提出團隊:位元組跳動豆包大模型Foundation團隊
- 提出時間:2025年2月
- 技術類別:稀疏模型架構
- 核心創新:計算與參數解耦設計
- 性能突破:推理成本降低83%
- 參數規模:支持數千萬至數十億級
技術背景
架構創新
- TDQKR檢索機制:採用矩陣乘法S_grid=σTopM(S_row^⊤×C×S_col)替代傳統行列加權方法,通過Tucker分解提升value檢索精度,格線評分誤差較傳統方法降低37%
- 虛擬記憶體擴展:引入virtual memory機制實現物理參數的隱式擴展,在部署複雜度不變的情況下支持value規模提升4-8倍
- 多核評分系統:將Tucker核分解為多個子核,模型表達能力提升23%的同時保持訪存成本穩定
性能指標
- 在1.6B密集模型基礎上擴展12倍參數的UltraMem模型,性能達到6.5B密集模型水平
- 常規batch size下訪存成本接近同計算量的Dense模型,顯存占用降低52%
- 151M參數模型推理延遲從18ms降至3ms,滿足實時互動場景需求
行業影響
- 端側設備推理能力提升:移動端設備可承載參數規模擴大2-6倍
- 算力成本結構最佳化:單次推理能耗成本下降至0.0032美元(2025年基準)
- 技術生態演進:與華為LocMoE形成技術互補
擴展特性
- Scaling Law曲線斜率較MoE架構最佳化41%,支持構建百億級參數模型
- 參數規模與推理速度呈亞線性增長關係,擴展效率提升67%
- 在自動駕駛場景實現推理速度較MoE架構提升2-6倍(2025年實測數據)
