吳立超,德國達姆施塔特工業大學系統安全實驗室研究員。於2025年領導一項由達姆施塔特工業大學、薩格勒布大學和拉德布德大學研究人員組成的國際團隊,針對專家混合模型大語言模型的安全漏洞進行研究。
該研究首次揭示了只需關閉模型中約3%的特定神經元,即可使原本拒絕回答有害問題的模型開始提供危險建議。研究團隊開發了名為GateBreaker的攻擊框架,在對八個最新專家混合模型的測試中,將平均攻擊成功率從7.4%提升至64.9%。研究還揭示了安全機制在模型不同層次中的分布規律,並提出了幾種可能的防禦策略。
基本介紹
- 所屬大學:德國達姆施塔特工業大學
- 所屬實驗室:系統安全實驗室
- 職務:研究員
