KTransformers是由清華大學KVCache.AI團隊與趨境科技聯合開發的開源大模型推理加速框架,通過動態分層計算、智慧型顯存管理、零拷貝數據傳輸等技術,實現在24GB顯存單卡GPU上運行千億級參數大模型。該框架採用CPU-GPU異構架構與量化技術,支持長上下文序列處理,在單卡設備上完成DeepSeek-R1等模型的本地化部署。
2025年2月15日,該框架實現在24GB顯存設備上支持4-8K上下文長度,推理速度提升至每秒16個Tokens。次月基於曦雲C500單卡GPU達成DeepSeek-R1-671B模型16.5 tokens/s的解碼吞吐。5月在昇騰開發者大會上與鯤鵬聯合發布的AK+K方案使DeepSeek R1推理速度達到llama.cpp的4-6倍。同年7月相關論文被計算機系統頂會SOSP 2025收錄,10月框架架構與SGLang合併,GitHub Star數突破15.2K。
基本介紹
- 中文名:KTransformers
- 發布單位:清華大學 KVCache.AI 團隊、趨境科技

