吳立超

吳立超,德國達姆施塔特工業大學系統安全實驗室研究員。於2025年領導一項由達姆施塔特工業大學、薩格勒布大學和拉德布德大學研究人員組成的國際團隊,針對專家混合模型大語言模型的安全漏洞進行研究。

該研究首次揭示了只需關閉模型中約3%的特定神經元,即可使原本拒絕回答有害問題的模型開始提供危險建議。研究團隊開發了名為GateBreaker的攻擊框架,在對八個最新專家混合模型的測試中,將平均攻擊成功率從7.4%提升至64.9%。研究還揭示了安全機制在模型不同層次中的分布規律,並提出了幾種可能的防禦策略。

基本介紹

  • 所屬大學:德國達姆施塔特工業大學
  • 所屬實驗室:系統安全實驗室
  • 職務:研究員
主要發現:MoE模型安全漏洞,GateBreaker攻擊框架,學術影響與後續工作,

主要發現:MoE模型安全漏洞

2025年,吳立超領導的國際研究團隊發表了一項研究,首次揭示了專家混合模型(MoE)大語言模型在安全防護方面的漏洞。研究團隊發現,只需巧妙地關閉模型中約3%的特定神經元,就能使原本拒絕回答有害問題的AI模型變得有問必答,甚至開始提供危險建議。
研究團隊開發了名為GateBreaker的攻擊框架,在對八個最新的專家混合模型進行測試時,該框架將平均攻擊成功率從7.4%提升至64.9%。研究還揭示了安全機制在模型不同層次中的分布規律,並提出了幾種可能的防禦策略。

GateBreaker攻擊框架

吳立超領導的研究團隊開發了一個名為“GateBreaker”的攻擊框架,專門破壞AI系統的“安全門禁”。在對八個最新的專家混合模型進行測試時,GateBreaker將平均攻擊成功率從7.4%提升至64.9%。

學術影響與後續工作

2025年,吳立超領導的國際研究團隊在專家混合模型(MoE)大語言模型的安全防護領域取得突破性發現。研究揭示了此類模型的安全機制存在顯著脆弱性。通過名為“GateBreaker”的攻擊框架,僅需“關閉”模型中約3%的特定神經元,即可使原本拒絕有害請求的模型變得順從。在對八個最新模型的測試中將平均攻擊成功率從7.4%大幅提升至64.9%。研究揭示了安全機制在模型不同層次中的分布規律,並提出了幾種可能的防禦策略。

相關詞條

熱門詞條

聯絡我們