曾旺丁

曾旺丁,湖南新化人,DeepSeek團隊核心成員,人工智慧專家。2017年至2023年就讀於北京郵電大學,本科畢業於計算機學院(國家示範性軟體學院),後保研至人工智慧學院模式識別與智慧型系統實驗室,師從郭軍教授團隊的張洪剛教授攻讀信息與通信工程專業碩士學位,研究方向為圖像識別,2018年獲全國大學生數學競賽(非數學類)二等獎。參與研發DeepSeek-V2等大模型,共同提出MLA(Multi-head Latent Attention)架構最佳化計算效率,並與高華佐等人共同開發該架構,顯著降低推理顯存占用。主導GRPO算法研究推動強化學習領域發展,相關成果發表於《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》論文。其研究聚焦減少模型計算量、最佳化推理顯存及高效模型結構設計。

基本介紹

  • 姓名:曾旺丁
  • 籍貫:湖南新化
  • 畢業院校:北京郵電大學     
  • 導師:張洪剛     
  • 專業:信息與通信工程 
  • 團隊:DeepSeek      
求學經歷,學術成就與貢獻,未來展望,社會評價,

求學經歷

曾旺丁於2017年至2023年就讀於北京郵電大學人工智慧學院,本科期間就讀於計算機學院(國家示範性軟體學院),後保研至人工智慧學院模式識別與智慧型系統實驗室(pris),師從郭軍教授團隊的張洪剛老師,專業為信息與通信工程,研究方向為圖像識別。在北郵的七年求學經歷中,他從一個初學編程的學生成長為能夠獨立實現小型語法分析器,並成功訓練首個手寫字元識別神經網路的專業人才。

學術成就與貢獻

在DeepSeek團隊中,曾旺丁展現了其深厚的專業知識和創新能力。他參與了DeepSeek大模型的重要研發工作,特別是在減少計算量和推理顯存、高效模型結構設計與最佳化方面做出了突破性創新。他與高華佐等人共同提出了MLA(Multi-head Latent Attention)架構,這一創新成果不僅提升了模型的性能,還降低了對硬體資源的需求,為大模型的廣泛套用鋪平了道路。此外,曾旺丁還主導了GRPO算法的研究和開發工作,深入分析了強化學習中的關鍵問題和難點,為DeepSeek-Math項目和整個強化學習領域的發展帶來了新的突破。

未來展望

對於未來,曾旺丁堅信深度神經網路的潛力,並相信通用人工智慧(AGI)將在不遠的未來成為現實。他希望通過團隊共同的努力,為大家帶來更好的大模型,為人工智慧領域的發展做出更大的貢獻。

社會評價

曾旺丁作為DeepSeek團隊中的年輕成員,以其卓越的才華和貢獻受到了廣泛的關注和認可。他在AI領域的早期成就不僅展現了其深厚的技術功底,也為國產AI大模型領域的發展注入了新的活力。

相關詞條

熱門詞條

聯絡我們