評測與發布
在綜合評測中,Seedance 1.5 pro 各項關鍵能力處於“業界前列”。
根據內部基準測試SeedVideoBench-1.5的結果,Seedance 1.5 pro在聲音質量、音畫同步、聲音表現力等核心指標上均超越了行業內其他同類模型,尤其是在指令遵循和畫面美感方面較之前的Seedance1.0Pro有了顯著提升。
在視頻能力評估中,Seedance 1.5 pro 在文本生成視頻(T2V)的對齊度(Alignment)指標上取得領先,並在其他多項指標(T2V 的畫面美感以及圖像生成視頻 I2V 的對齊度與運動)上位居前列。而在音頻能力評估中,Seedance 1.5 pro 在生成質量、同步性、對齊度、表現力等多項指標上全方位超越 Veo 3.1 和 Kling 2.6。
2025年12月18日,
火山引擎在FORCE原動力大會上正式發布
豆包視頻生成模型Seedance 1.5 pro。2025年12月19日,
位元組跳動新一代音視頻創作模型 “Seedance1.5Pro” 正式登入豆包,為普通用戶打開了 “零門檻做有聲視頻” 的新體驗。在2025年12月16日,位元組跳動在北京舉行了發布會,展示了模型在多種套用場景中的潛力。
該模型已於2025年12月19日正式登入豆包,用戶可通過對話框選擇“照片動起來”功能,上傳參考圖並輸入提示詞,選擇“1.5 Pro”模型來直接生成完整的有聲視頻。
目前,個人用戶已可在
豆包、
即夢AI、火山方舟體驗中心等平台體驗該模型;企業用戶可從2025年12月23日起,通過
火山引擎API接入Seedance 1.5 pro模型服務。
主要功能
Seedance 1.5 pro支持音視頻聯合生成,能夠執行多種任務,包括從文本到音視頻的合成以及圖像引導的音視頻生成等。這一版本提升了生成內容的視覺衝擊力和運動效果。模型具備影視級的敘事張力,能夠精準捕捉運動細節並細膩呈現人物情緒,在敘事連貫性和人物表情呈現方面有增強。該模型還提供音畫同步功能,實現精準音畫同步和較高的視聽一致性;模型能深度理解文本意圖,同步生成匹配內容的畫面與音效、台詞,避免音畫脫節。在音畫同步技術上取得了突破性進展,採用創新的原生音視頻聯合生成架構,支持環境音、背景音樂、人聲等多種元素,涵蓋環境音、動作音等多種音效類型,實現了毫秒級的音畫同步輸出。能夠原生生成多種音效元素,包括環境音、動作音和背景音樂。支持多語言和方言的語音生成,能夠捕捉其獨有的語音韻律與情感張力;在對白處理上,模型支持多人多語言對話,口型對齊精準,覆蓋中文方言(如
四川話、
粵語等)、英文及小語種。生成的人物台詞語氣、節奏更貼近真人表達。具備鏡頭控制能力,如運鏡和變焦效果,包括動態手持拍攝和景深控制等效果,並具備電影級運鏡控制與動態張力,包括自發的鏡頭調度能力和電影級的畫面銜接與專業影調;畫面會自帶景別切換、運鏡效果,複雜動作(比如人物的肢體互動)也能被精準捕捉。並通過增強語義理解改善敘事連貫性,具體表現為語義理解與敘事協調性增強,實現了對敘事語境的精準解析。此外,模型即將上線“Draft樣片”功能,可先生成低解析度樣片進行預覽,關鍵要素與最終成片高度一致,提升65%的整體效率並減少60%的無效創作成本。支持離線推理,進一步降低視頻生成成本,適用於批量生產和異步處理場景。普通用戶可以通過豆包 App 對話框,點擊“照片動起來”功能,選擇“1.5Pro”模型,上傳一張參考圖並輸入提示詞,即可直接生成一條完整的有聲視頻。
套用領域
Seedance 1.5 pro在影視藝術創作、短劇生成、廣告製作以及戲曲演繹等多個領域展現了優異的表現力和視聽融合度。在電商領域,模型可用於生成商品展示視頻,並支持多語言適配,便於本地化行銷。在廣告行銷方面,模型能夠快速生成個性化廣告內容。此外,在喜劇等需要風格化表演的內容創作中,其多語種和方言支持能展現出更鮮活的生動感。同時,在ASMR視頻生成、情緒細膩表達、賽車與戰爭等動態場景處理方面也表現出色,例如生成ASMR內容時能精準捕捉聲音細節,在情緒表達上呈現大笑、憤怒、悲傷等細膩變化,在賽車和戰爭場景中處理複雜動態流暢自然。
發展歷史
2025年6月,視頻生成模型Seedance1.0 Pro正式發布。
2025年12月18日,
火山引擎在2025年冬季FORCE原動力大會上正式發布Seedance 1.5 pro音視頻創作模型。
2025年12月23日,企業用戶可通過火山引擎API接入Seedance 1.5 pro模型服務。
影響
Seedance 1.5 Pro 的發布標誌著音視頻創作進入了一個新的時代,並推動了行業的發展與創新。
在不到兩年的時間裡,視頻生成技術從學界研究熱點走入大眾視野,成為普通人也能直觀感受和使用的創作工具。視頻生成早已邁過「人類直覺可接受」的階段,而開始真正邁向「創作級、生產級」階段。藉助 AI 視頻創作工具,幾個人甚至單人小團隊就可以完成過去需要影視工作室才能完成的視頻內容。目前,Seedance 1.5 pro 正在多樣化的視頻生成場景釋放巨大的套用潛力,尤其是多鏡頭視頻生成的實際生產,逐步向支撐專業級視頻內容創作轉變。在未來的視頻生產體系中,包括 Seedance 1.5 pro 在內的視頻生成大模型將以更加成熟的方式參與從創意生成到內容製作的全過程,它們的使用比重有望繼續提升,承擔的角色也會更加重要。
技術架構
Seedance 1.5 Pro 在架構層面即原生支持音視頻聯合生成,包括文本到音視頻生成和基於圖像引導的音視頻生成。它融合了幾項關鍵技術創新,包括統一的多模態聯合生成架構、全面的音視頻數據框架、精細化的後訓練最佳化策略和高效的推理加速方案。
具體而言,模型採用基於 MMDiT 架構的統一建模框架,支持跨模態的深度互動,確保視覺與聽覺信號實現時間維度上的精準同步以及語義層面的高度一致。
在數據層面,構建了一套面向高質量音視頻生成的整體數據框架,涵蓋多階段數據篩選與清洗、先進的數據標註系統以及可規模化的基礎設施。
在訓練階段,引入了監督微調(
SFT)和基於人類反饋的強化學習(
RLHF)算法,利用多維度獎勵模型提升文本到視頻和圖像到視頻生成任務的整體表現,並對 RLHF 訓練流程進行工程最佳化,使整體訓練速度提升近三倍。
在推理階段,最佳化多階段蒸餾框架,顯著降低了生成過程中所需要的函式評估次數(NFE),並結合量化、並行計算等推理基礎設施層面的最佳化,在保持模型性能的前提下,實現了 10 倍 + 的端到端推理加速。