Sora 2是OpenAI於當地時間2025年9月30日(台北時間10月1日凌晨)發布的新一代視頻生成模型,OpenAI在官方部落格中表示,“Sora 2是視頻生成領域的 GPT-3.5時刻。”。
美國當地時間2024年2月15日,OpenAI在官網發布視頻生成模型Sora,該模型可根據文字生成一段長達1分鐘的視頻。當地時間2025年9月30日,OpenAI發布視頻生成模型Sora 2,向所有用戶免費開放,並推出一款iOS套用Sora(Sora 2是Sora APP的技術底座)。其核心突破是從一個“視頻生成器”進化為一個“世界模擬器”,在物理模擬、真實感和可控性方面顯著提升。Sora 2能夠處理複雜的動作場景,如體操或划槳運動,同時遵循物理規則,如動量和浮力。另一個重大突破,是在生成畫面的同時,還能同步生成與之匹配的環境音、物體互動聲,甚至是符合語境的對話;雖然 AI 視頻和音頻現在都很強,但“聲畫一體”帶來的真實感完全不同,這讓 AI 視頻真正擁有了“靈魂”。
台北時間10月16日,就在Sora 2發布半個月後,谷歌火速推出了最新視頻模型Veo 3.1和Veo 3.1 Fast,正面迎戰OpenAI。OpenAI也放出了Sora 2的更新,稱普通用戶可以生成15秒的視頻,專業用戶則可以生成長達 25 秒的視頻。10月17日,微軟宣布,OpenAI的新一代多模態視頻生成模型Sora 2現已在Azure AI Foundry(國際版)上線,進入公共預覽階段。即日起,Sora 2可通過Standard Global API在Azure AI Foundry(國際版)上開啟使用,定價0.1美元/秒。
變體
Sora 2 系列目前提供兩個變體,針對不同使用場景最佳化。
Sora 2:注重速度與靈活性,適用於創意探索階段,注重快速反饋而非極致畫質。特點是生成速度快、質量佳,適合快速疊代、概念驗證或粗剪階段。推薦用途:社交媒體內容、產品原型、需要快速產出的項目。
Sora 2 Pro:支持專業級畫質,適用於需要高質量視頻的場景、可直接用於生產的內容。其渲染時間更長、成本更高,但輸出更加穩定、細膩、逼真。推薦用途:高解析度電影鏡頭、行銷視頻、以及對視覺精度要求極高的項目。
功能特色
Sora 2將重塑AI視頻生成領域
Sora 2則被定位為“GPT-3.5時刻”,在物理模擬、真實感和可控性方面顯著提升。Sora 2能夠處理複雜的動作場景,如體操或划槳運動,同時遵循物理規則,如動量和浮力。相較於早期系統可能出現的“籃球瞬間傳送進籃筐”等問題,Sora 2能夠真實模擬投籃未中時的反彈效果。此外,該模型還能同步生成對話、背景音效和聲音效果,創造出從逼真到動漫風格的統一視聽體驗。“入鏡”功能是Sora 2的一大亮點。用戶只需進行一次性短視頻錄製,捕捉自己的形象和聲音,即可將自己或朋友插入生成的視頻場景中。直播中,OpenAI強調該功能完全基於用戶自願參與,設有驗證機制以防止冒充,且用戶可隨時撤銷授權。
布洛克曼:我們決定構建何種產品界面,核心取決於模型的能力,這與ChatGPT的推出邏輯一致。當時我們發現,模型具備泛化能力並能利用對話上下文信息,本質上更適合成為聊天模型。對於Sora 2,我們也有類似判斷,需基於模型的優勢、劣勢及核心新功能確定方向。但對我而言,任何產品界面或模型後訓練(Post-training),都會在深層次上縮小原始模型的潛力。這些原始基座模型(Raw Base Models)的使用門檻極高,但蘊含“宇宙級” 的可能性。