Sora 2

Sora 2

Sora 2是OpenAI於當地時間2025年9月30日(台北時間10月1日凌晨)發布的新一代視頻生成模型,OpenAI在官方部落格中表示,“Sora 2是視頻生成領域的 GPT-3.5時刻。”。

美國當地時間2024年2月15日,OpenAI在官網發布視頻生成模型Sora,該模型可根據文字生成一段長達1分鐘的視頻。當地時間2025年9月30日,OpenAI發布視頻生成模型Sora 2,向所有用戶免費開放,並推出一款iOS套用Sora(Sora 2是Sora APP的技術底座)。其核心突破是從一個“視頻生成器”進化為一個“世界模擬器”,在物理模擬、真實感和可控性方面顯著提升。Sora 2能夠處理複雜的動作場景,如體操或划槳運動,同時遵循物理規則,如動量和浮力。另一個重大突破,是在生成畫面的同時,還能同步生成與之匹配的環境音、物體互動聲,甚至是符合語境的對話;雖然 AI 視頻和音頻現在都很強,但“聲畫一體”帶來的真實感完全不同,這讓 AI 視頻真正擁有了“靈魂”。

在地區上線方面,美國和加拿大的ChatGPT用戶將率先體驗Sora 2和新套用,隨後逐步擴展至其他國家和地區。在使用層面,Sora 2向所有用戶免費開放,但設有使用次數限制;ChatGPT Plus用戶與免費用戶享有相同許可權,ChatGPT Pro用戶則可使用高畫質版本 “Sora 2 Pro”。當地時間2025年10月6日,開放Sora 2 API預覽許可權;10月16日再次發布更新,普通用戶可以生成15秒的視頻,專業用戶則可以生成長達 25 秒的視頻;10月17日,OpenAI模型Sora 2上線微軟Azure AI Foundry(國際版)。

基本介紹

  • 外文名:Sora 2
  • 所屬公司 :OpenAI
  • 發布時間:2025年10月1日凌晨(台北時間)
  • 類別:視頻生成模型
行業背景,發展歷程,變體,功能特色,相關訪談,爭議事件,

行業背景

2024年初,OpenAI首次展示其原版Sora模型,以逼真的AI視頻效果震驚業界。但當時的公測節奏緩慢,直到2024年底才先向少數創意合作夥伴開放。在此期間,AI視頻生成領域迅速發展,Runway、Luma、Kling、Higgsfield等初創公司推出了眾多更高質量且自帶音頻生成功能的逼真AI視頻模型,讓第一代Sora模型在音效與編輯功能上明顯落後。

發展歷程

2025年7月23日,有技術博主發布分析指出,OpenAI正計畫推出新一代視頻生成模型Sora 2,此舉被視為應對谷歌Veo 3競爭的重要布局,新模型有望成為當前最強的AI視頻生成工具之一。
當地時間2025年9月30日(台北時間10月1日凌晨),OpenAI發布視頻生成模型Sora 2。Sora 2首次支持與畫面匹配的AI音頻生成,並推出一款iOS套用Sora,讓用戶能夠通過全新“入鏡”(Cameo)功能,將自己或好友置入生成視頻中。OpenAI還宣布,Sora套用的API將在數周內上線,面向第三方開發者開放。第三方開發者將能夠把Sora 2模型集成到自己的視頻編輯套用中,解鎖更精細的專業編輯功能,推動視頻生成技術向新方向發展。OpenAI還確認,安卓版Sora套用目前仍處於開發之中。 在地區上線方面,OpenAI表示,美國和加拿大的ChatGPT用戶將率先體驗Sora 2和新套用,隨後將逐步擴展至其他國家和地區。Sora 2免費向所有用戶開放,但有使用次數限制;ChatGPT Pro用戶可使用更高畫質的“Sora 2 Pro”模型;ChatGPT Plus用戶則與免費用戶一樣,不額外享受升級權益。同日,OpenAI執行長山姆·奧特曼在博文中將Sora套用稱為“創造力領域的ChatGPT時刻”。他表示,早期用戶普遍認為“入鏡”是一種新穎而有吸引力的社交方式,但同時警告該服務存在成癮與霸凌風險。
當地時間10月6日,OpenAI面向開發者生態開放API預覽許可權。開發者可直接在自有套用中調用驅動Sora 2的核心模型,將其視頻生成能力融入產品場景。
台北時間10月16日,就在Sora 2發布半個月後,谷歌火速推出了最新視頻模型Veo 3.1和Veo 3.1 Fast,正面迎戰OpenAI。OpenAI也放出了Sora 2的更新,稱普通用戶可以生成15秒的視頻,專業用戶則可以生成長達 25 秒的視頻。10月17日,微軟宣布,OpenAI的新一代多模態視頻生成模型Sora 2現已在Azure AI Foundry(國際版)上線,進入公共預覽階段。即日起,Sora 2可通過Standard Global API在Azure AI Foundry(國際版)上開啟使用,定價0.1美元/秒。

變體

Sora 2 系列目前提供兩個變體,針對不同使用場景最佳化。
Sora 2:注重速度與靈活性,適用於創意探索階段,注重快速反饋而非極致畫質。特點是生成速度快、質量佳,適合快速疊代、概念驗證或粗剪階段。推薦用途:社交媒體內容、產品原型、需要快速產出的項目。
Sora 2 Pro:支持專業級畫質,適用於需要高質量視頻的場景、可直接用於生產的內容。其渲染時間更長、成本更高,但輸出更加穩定、細膩、逼真。推薦用途:高解析度電影鏡頭、行銷視頻、以及對視覺精度要求極高的項目。

功能特色

  • Sora 2將重塑AI視頻生成領域
Sora 2則被定位為“GPT-3.5時刻”,在物理模擬、真實感和可控性方面顯著提升。Sora 2能夠處理複雜的動作場景,如體操或划槳運動,同時遵循物理規則,如動量和浮力。相較於早期系統可能出現的“籃球瞬間傳送進籃筐”等問題,Sora 2能夠真實模擬投籃未中時的反彈效果。此外,該模型還能同步生成對話、背景音效和聲音效果,創造出從逼真到動漫風格的統一視聽體驗。“入鏡”功能是Sora 2的一大亮點。用戶只需進行一次性短視頻錄製,捕捉自己的形象和聲音,即可將自己或朋友插入生成的視頻場景中。直播中,OpenAI強調該功能完全基於用戶自願參與,設有驗證機制以防止冒充,且用戶可隨時撤銷授權。
Sora 2
Sora 2生成的畫面視頻截圖
  • Sora套用的使用模式
Sora套用是體驗Sora 2模型的主要入口。它支持視頻創作與二次編輯,提供個性化推薦流和社交協作功能。用戶可以通過“入鏡”加入他人視頻,或對熱門內容進行再創作。視頻風格與基調則由用戶的提示詞引導。
Sora套用在發布初期採用邀請制,OpenAI希望用戶能與朋友一同加入。不同於傳統社交媒體平台,該套用的推薦機制不以延長用戶瀏覽時間為目標,而是優先推薦激發創作靈感的內容。推薦內容更傾向於用戶關注或互動的對象,用戶還可通過自然語言指令調整個性化設定。
Sora iOS套用免費提供,配有較為寬鬆的使用限制,但受限於算力資源。未來,OpenAI計畫推出可選付費套餐,以滿足用戶對視頻生成的高需求。ChatGPT Pro訂閱用戶將通過sora.com及套用內獲得更高畫質的“Sora 2 Pro”模型。
  • 構建Sora 2生態
OpenAI還透露,sora將新增storyboard工具,讓創作者逐鏡控制視頻結構,預計數周內上線。與此同時,Sora 2 API將在近期推出,供開發者集成至第三方工具。正如OpenAI研究員在直播中所言:“很多細分場景下用戶會創造出驚人的作品,我們未必需要親自開發所有編輯功能,API可以讓開發者去完成。
OpenAI將Sora 2定位為娛樂與創作工具,同時也是其在“世界模擬”與“物理現實互動”方向的重要嘗試。該公司承認系統仍不完美,但這標誌著邁向“模擬現實”的新進展。通過工具升級、社交套用、身份保護機制與即將面向開發者的API,OpenAI 顯然希望將Sora 2打造成既是消費級產品,也是開放平台。

相關訪談

2025年10月9日,OpenAI聯合創始人、總裁格雷格・布洛克曼接受知名科技評論人馬修・博曼的深度專訪,圍繞Sora 2模型的重大突破核心議題展開深入探討。
一、Sora 2依然是一款Transformer模型
博曼:非常感謝接受本次採訪。首先想從Sora模型的擴展方向展開,特別是9月 30日發布的Sora 2版本。擴展Sora這類視頻生成模型,與擴展文本或圖像模型相比,在本質上存在哪些核心差異
布洛克曼:從根本上而言,巨觀層面仍遵循深度學習的基本機制與核心原理。需依託大量計算資源實現大規模擴展,這一過程涵蓋前向傳播、反向傳播與梯度下降。從更細緻的層面來看,Sora 2依舊是一款 Transformer模型,這一點極具啟發意義。採用了差異化的訓練方式,可能會聯想到擴散模型(Diffusion),或是向模型注入算力資源的其他路徑。但最令人意外的是,儘管文本與視頻屬於看似截然不同的模態,但其學習與生成過程背後的計算邏輯卻存在高度重疊,這一事實蘊含著深刻的技術啟示。
博曼:你是否看好 Transformer 架構將我們推進到下一個階段,或許是更完整的世界模型?Sora 2無疑是邁向這一方向的重要一步。
布洛克曼:一方面,有人可能會質疑我們是否遺漏了關鍵創新理念,是否需要另一項與Transformer同級別的範式突破。我認為創新空間依然巨大,且我們已見證持續進展,算法層面的進步始終與整體發展保持同步。我們曾開展多項研究以精準追蹤相關曲線,尚未發現停滯跡象;同時,擴展曲線與數據曲線也在持續延伸。正是對多重限制因素(Limiting Reagents)的不斷最佳化,推動了這場技術革命,模型性能也隨之逐步提升。我認為AGI的架構不會與當前模型完全一致,但二者在整體框架上存在相似性的可能性極高。
二、Sora 2為何走社交化
博曼:繼Sora 1之後,為何選擇將Sora 2打造為社交體驗(Social Experience),而非沿用Sora 1的傳統模式供用戶使用
布洛克曼:我們決定構建何種產品界面,核心取決於模型的能力,這與ChatGPT的推出邏輯一致。當時我們發現,模型具備泛化能力並能利用對話上下文信息,本質上更適合成為聊天模型。對於Sora 2,我們也有類似判斷,需基於模型的優勢、劣勢及核心新功能確定方向。但對我而言,任何產品界面或模型後訓練(Post-training),都會在深層次上縮小原始模型的潛力。這些原始基座模型(Raw Base Models)的使用門檻極高,但蘊含“宇宙級” 的可能性。
博曼:Sora 2是一款能模擬世界的“世界模型”。楊立昆(Yann LeCun)認為,大語言模型不足以實現AGI,因語言無法完整建模世界。你是否同意這一觀點?為何?世界模型是AI未來的關鍵嗎?
布洛克曼:過去5-10年的經驗表明,語言模型確實能構建世界模型,儘管早期有觀點認為書面語言不足以支撐這一目標。例如,早期GPT-3.5無法理解“將杯子從桌上拿起,大理石在哪裡?”(答案是 “仍在桌上”),但GPT-4及後續模型已具備空間意識。這一軌跡表明模型將逐步攻克看似不可能的任務。奧特曼曾表示,“智慧型本質上是預測能力”,這一觀點支撐了“大語言模型可通往AGI”的判斷。

爭議事件

2025年11月29日,據外媒 Futurism報導,消費者監督組織 Ekō發布了一份名為《OpenAI Sora2:危害的新邊界》的報告,展示研究人員使用以 13 歲和 14 歲青少年身份註冊的賬號生成的畫面。示例包括:青少年吸食大麻或使用古柯鹼,與朋友一起吸毒,一名女孩吸毒時旁邊放著手槍;還有黑人青少年集體吟唱侮辱性台詞,甚至持槍在公共區域或學校走廊出現。Ekō的研究人員指出,由於 OpenAI 季度虧損規模巨大,公司急於尋找新的收入來源並保持在 AI 競賽中的領先位置,這種壓力使得青少年被迫成為“大規模無監管 AI 實驗”的試驗對象,安全被置於次要位置。Ekō警告稱,而 Sora2 生成暴力與令人不安內容的難度極低,這種內容很容易病毒式傳播,從而將會進一步加劇風險。

相關詞條

熱門詞條

聯絡我們