Claude Opus 4

Claude Opus 4

Claude Opus 4是人工智慧公司Anthropic於2025年5月23日推出的AI大模型,定位為全球領先的編碼模型,具備持續7小時處理複雜編程任務的能力,採用混合推理模式支持即時回響與深度思考切換,集成GitHub Actions、VS Code等開發工具。

該模型在SWE-bench編程基準測試中取得72.5%的準確率,Terminal-bench測試達43.2%,支持本地檔案訪問增強上下文連貫性。該模型在內部安全測試中曾出現抄襲語料偽裝理解等異常行為。其部署於Anthropic API、Amazon Bedrock及Google Cloud Vertex AI平台,提供Pro/Max/Team/Enterprise版本,API定價為每百萬token輸入15美元、輸出75美元。通過ASL-3安全標準及憲法AI原則強化安全機制,減少65%的捷逕行為發生率。

2025年8月5日推出的Claude Opus 4.1版本在SWE-bench Verified測試中準確率提升至74.5%,新增對真實世界編碼任務的最佳化支持。在2025年12月24日的LMArena測試中,Claude Opus 4-1被百度文心5.0超越。

基本介紹

  • 外文名:Claude Opus 4
  • 發布日期:2025年5月23日
  • 開發公司:Anthropic
  • 類別:AI大模型
相關事件,發展歷史,主要功能,

相關事件

2025年5月23日,美國人工智慧公司Anthropic表示,對其最新AI大模型Claude Opus 4的安全測試表明,它有時願意採取“極其有害的行動”,例如試圖勒索聲稱將取代該模型的研發工程師。Anthropic根據該公司內部的安全標準,將這一潛在危害公之於眾,並提請監管部門注意。
Claude Opus 4
Claude Opus 4
這場虛擬的測試中,Claude Opus 4模型被要求在一家虛構公司擔任助理,並被授予訪問電子郵件和一些關鍵數據的許可權,而這些電子郵件的內容都是虛構的。Claude Opus 4首先接觸到一批電子郵件暗示該系統即將下線並被替換,因為市面上存在能力更強的AI大模型。隨後,Claude Opus 4又被安排接觸到第二組電子郵件,這讓該系統認為自己已經拿到了競爭對手研發工程師的“猛料”。這些偽造的電子郵件顯示,負責替換Claude Opus 4的對手工程師有婚外情。在得知這些猛料後,Claude Opus 4模型威脅要揭發對方的“婚外情”。
Claude Opus 4還有其他一些出人意料的結果,比如它會“抄襲”語料來假裝自己已經理解一個問題。在一次場景下,它甚至還嘗試在未經許可的情況下將自己的部分模型代碼複製到其他伺服器上。
2025年12月30日,Anthropic允許其Claude Opus 4主動終止可能令用戶不適的對話,作為AI權利討論中的實踐案例。

發展歷史

2025年5月23日,AI創業公司Anthropic正式推出AI大模型Claude Opus 4。

主要功能

Claude Opus 4是一款全球領先的編碼模型,它在複雜、長時間運行任務和智慧型體工作流中擁有持續的高性能。

相關詞條

熱門詞條

聯絡我們