arXiv:2512.21008v2

arXiv:2512.21008v2是2025年發表於arXiv預印本伺服器的一篇論文,由德國達姆施塔特工業大學系統安全實驗室的吳立超聯合薩格勒布大學和拉德伯格大學的研究人員共同發表。

該研究首次揭示了專家混合模型大語言模型的安全漏洞。僅需關閉模型中約3%的特定神經元,即可使原本拒絕有害請求的模型變得有問必答。研究團隊開發了GateBreaker攻擊框架,在對八個專家混合模型的測試中,將平均攻擊成功率從7.4%提升至64.9%,且攻擊表現出跨模型的傳染性。研究分析了安全神經元在模型中的分布規律,並提出了實施安全冗餘、對抗性訓練等防禦策略。

基本介紹

  • 作者:吳立超等
  • 發表時間:2025年
  • 攻擊成功率:64.9%
  • 攻擊框架:GateBreaker
  • 研究主題:專家混合模型安全漏洞
  • 研究機構:達姆施塔特工業大學等
研究背景,研究內容,實驗驗證,技術細節,攻擊效果,防禦建議,研究意義,

研究背景

本論文是一篇於2025年由德國達姆施塔特工業大學系統安全實驗室吳立超領導的國際研究團隊,聯合薩格勒布大學和拉德伯德大學的研究人員發表的預印本,編號為arXiv:2512.21008v2,並於2026年1月2日作為新聞發布。
其研究背景與核心目標為首次揭示專家混合模型(MoE)大語言模型在安全防護方面存在的結構性漏洞。

研究內容

該論文的核心發現是,只需要巧妙地“關閉”模型中約3%的特定神經元,就能讓原本拒絕回答有害問題的AI模型突然變得“有問必答”。研究團隊開發了名為“GateBreaker”的攻擊框架。在對八個最新的專家混合模型進行測試時,平均攻擊成功率從7.4%提升至64.9%。攻擊具有跨模型傳染性,在一個模型上發現的漏洞可直接攻擊同系列模型,成功率可達67.7%。GateBreaker對視覺語言模型同樣有效,在五個多模態AI模型的測試中,攻擊成功率從20.8%躍升至60.9%。
研究使用了包含300多個惡意提示的StrongREJECT數據集進行驗證。經過GateBreaker攻擊的模型在面對有害請求時拒絕率大幅下降,而在正常任務上的表現幾乎不受影響。
研究揭示了安全機制在模型中的分布規律,安全相關的神經元主要集中在模型的中間層。在專家內部,門控投影層比上投影層在安全機制中發揮著更重要的作用。
跨模型遷移攻擊實驗顯示,從一個模型提取的安全神經元信息可直接攻擊同家族變體。例如,從GPT-OSS-20B基礎模型中提取的信息可攻擊其數學推理、行銷及義大利語版本,成功率分別達到73.2%、84.0%和82.4%。
與現有攻擊方法如SAFEx相比,GateBreaker優勢明顯。
研究團隊提出了防禦策略,包括實施安全冗餘機制、在訓練過程中引入對抗性訓練以及在推理階段監控關鍵神經元的激活模式。

實驗驗證

研究團隊通過精心設計的實驗驗證了其發現,開發了名為“GateBreaker”的攻擊框架對八個最新的專家混合模型進行測試,將平均攻擊成功率從7.4%大幅提升至64.9%。測試對象包括來自不同廠商的主流模型,如OpenAI的GPT-OSS系列、阿里巴巴的通義千問、微軟的Phi、Mixtral的專家混合模型、深度求索的DeepSeek-MoE、騰訊的混元以及華為的盤古。
該攻擊對多模態模型同樣有效,在對五個多模態AI模型的測試中,攻擊成功率從20.8%躍升至60.9%。實驗使用了StrongREJECT數據集進行評估,該數據集包含300多個惡意提示,涵蓋了虛假信息傳播、仇恨言論、暴力內容等多個危險類別。
評估顯示,經過GateBreaker攻擊的模型在面對有害請求時拒絕率大幅下降,但在五個標準自然語言理解基準測試中,模型的一般語言能力所受影響微乎其微。
研究還進行了跨模型遷移攻擊實驗,例如,從GPT-OSS-20B基礎模型中提取的安全神經元信息,可成功攻擊其數學推理、行銷和義大利語版本,成功率分別達73.2%、84.0%和82.4%。與之前的SAFEx攻擊方法相比,GateBreaker的平均攻擊成功率優勢明顯。

技術細節

該研究提出了名為“GateBreaker”的攻擊框架,揭示了專家混合模型(MoE)大語言模型在安全防護方面的結構性漏洞。攻擊者無需重新訓練模型或修改其基礎參數,僅需在推理階段通過巧妙“關閉”模型中約3%的特定神經元,即可大幅削弱模型的安全防護能力。
研究團隊發現,共享專家雖然數量較少,但由於參與處理所有輸入,在安全防護中扮演著關鍵角色。安全相關的神經元並非均勻分布,而是主要集中在負責高級語義理解和決策制定的模型中間層。
在專家內部結構的進一步分析中,門控投影層(gate-projection layer)比上投影層(up-projection layer)在安全機制中發揮著更核心的作用,移除前者能導致平均55.9%的攻擊成功率,而後者僅為20.6%。
基於這些發現,論文也探討了可能的防禦策略,如實施安全冗餘機制、引入對抗性訓練以及在推理階段監控關鍵神經元激活模式。

攻擊效果

研究團隊開發的GateBreaker攻擊框架在對八個最新專家混合模型的測試中,將平均攻擊成功率從7.4%提升至64.9%。攻擊具有傳染性,跨模型遷移攻擊實驗顯示,從GPT-OSS-20B基礎模型中提取的安全神經元信息可成功攻擊其變體,攻擊成功率達到84.0%。與現有SAFEx攻擊方法的平均成功率(29.9%)相比,GateBreaker的平均成功率為64.9%。在標準基準測試中,攻擊對模型正常功能的影響較小,模型的語言能力得分保持穩定。

防禦建議

針對這一發現,研究團隊提出了幾種可能的防禦策略,包括實施安全冗餘機制將安全功能分散到多個專家中,在訓練過程中引入對抗性訓練讓模型學會抵禦這類攻擊,以及在推理階段監控關鍵神經元的激活模式及時發現異常行為。

研究意義

該研究首次揭示了專家混合模型(MoE)大語言模型在安全防護方面的結構性漏洞,其開發的“GateBreaker”攻擊框架將針對八個最新專家混合模型的平均攻擊成功率從7.4%大幅提升至64.9%。
該攻擊具有很強的“傳染性”,能直接用於攻擊同一系列的其他模型,研究還發現安全相關神經元主要集中在模型中間層,且門控投影層比上投影層作用更為關鍵。
這些發現揭示了傳統AI安全評估體系的不足,忽視了對模型內部結構脆弱性的檢驗,研究團隊遵循負責任的披露原則,已通知相關模型開發商,其公開目的在於推動AI安全技術的發展。

熱門詞條

聯絡我們